aiminute. ← AIニュース一覧
うわさ AI Minute Newsroom 2026-08-21

噂:匿名の無料モデルはいまも智譜のものだとされる——だが名を上げたスコアは10問分で、全問走らせると平凡だった

噂:匿名の無料モデルはいまも智譜のものだとされる——だが名を上げたスコアは10問分で、全問走らせると平凡だった

これは未確認の噂であり、噂として掲載する。Ox Alphaという名のモデルが8月20日、OpenRouter上に「Stealth」とだけ記された匿名の提供者のもとで現れた。1週間無料、コンテキストウィンドウ1,048,576トークン、出力は最大131,072トークン、テキスト・画像・動画の入力に対応する。8月21日、研究者のベン・デイビス氏が指紋分析を公開し、このモデルは智譜のGLM-5ファミリーの未公開メンバーだと「99%確信している」と述べた。動画エンコーダのトークン消費がGLM-5V-Turboと完全に一致し、固定75トークンのラッパーを除けばトークナイザーがGLM-5.3と合致し、音声入力に対する拒否の挙動が同じで、エラーコードも同じ「1301」、出力中の絵文字比率も近い。同氏によれば、この分析はシャオミMiMo、DeepSeek、グーグル、Qwen、xAI、OpenAI、Anthropicを除外するという。いずれも確認されていない。8月23日時点でOx Alphaを名乗り出た企業はなく、智譜も何も語っていない。データの問題にも注意したい。OpenRouter自身のモデルページは、Ox Alphaに送られたプロンプトと応答は匿名の提供者によって保持される(訓練には使わない)と記している。一方でOpenCodeは同じモデルを「データ保持ゼロ」として宣伝していた。提供者の名が明かされるまでは、送ったものは名乗らない企業に保管されていると考えるのが安全だ。(訂正、8月23日:当初の記事で、Ox AlphaがDeepSWEコーディングベンチマークで80%のpass@1を記録し、Claude Fable 5の65%、GLM-5.3の62%、GPT-5.6-solの52%を上回ったと伝えた。この数字は10問の部分集合によるもので、ベンチマーク全体の9%未満だった。デイビス氏はその後113問すべてを走らせ、およそ63%を得た。これは他を上回るのではなく、GPT-5.6 Solと同水準である。同氏自身も、意味のある数字は全問走行のほうだと述べている。Ox Alphaはベンチマークの首位に立っていない。当社の見出しは立ったと書いており、それは誤りだった。)

なぜ重要か訂正そのものがこの記事の中身だ。10問の結果は2日で「匿名モデルがコーディングベンチマークで首位」として世界を一周した。それを覆す113問の結果は、その足元にも及ばない範囲にしか届かないだろう。あるモデルが他を大差で抜いたと聞いたら、最初に問うべきは何問解かせたのかである。小さな標本は、大きくて胸躍る、そして無意味な差を生む。残りは依然として有効だ。正体は証明されておらず、強いモデルを匿名かつ1週間無料で公開するのは贈り物ではなく流通経路である。ベンチマークはあなたであり、この件では提供者が送信内容を保持すると明言している。
#コーディング

⚠ 未確認のうわさ——慎重に

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

OpenAIが28日間、毎日の新機能か上限リセットを約束した
2026-10-05
AI製の報告が溢れ、グーグルは報奨金の受付を止めた。
2026-10-04
Anthropicが一万人の技術者をClaude導入役に育てる
2026-10-04
あるLinuxデスクトップが人工知能の書いたコードを拒みました。
2026-10-04
DeepSeekが自前の代理を卓上に置き、コードも公開しました。
2026-10-03