ツール
AI Minute Newsroom
2026-08-24
開発者が「effort」の表示値の低さに気づいた。Anthropicは配信構成を試験中で、その数字は今週だけ意味が違うと説明する。
8月22日の週末、Claude Codeの利用者が、ツールの「effort(努力度)」表示が想定より低い値を示していると投稿した。あるスクリーンショットでは100中10だった。さらに、同じ作業がOpus 5と旧来のOpus 4.6とで大きく異なる挙動を示し、ある例では同一の仕事に43分対2分の差が出たという。スレッドはHacker Newsのトップページに達した。AnthropicでClaude Codeチームを率いるThariq氏は公開の場で、同社が現在APIの配信構成を試験しており、その試験中は数値としての努力度が通常とは「異なる形で対応づけられている」と回答した。利用者が選んだ努力度がそのまま提供されるものであり、自社評価では性能低下は見られないとも述べている。スレッドの残りはそう簡単には決着しない。Opus 5の出力が望む以上に冗長で凝りすぎているという声が長く続き、4.6や競合ツールへ戻る人もいる。これらは印象であって測定ではなく、モデル品質についての印象は当てにならないことで知られる。ただしAnthropicが認めた具体的な事実はひとつある。画面に出ていた数字が、今週は先週と同じ意味ではなかったということだ。
なぜ重要か小さな出来事だが、トークン単位で能力を買うことについて大きな教訓を含んでいる。モデル提供事業者から借りているのは固定された品物ではない。重み自体は安定していても、その周囲の配信構成——量子化、振り分け、努力度の対応づけ、文脈の扱い——は絶えず調整されており、たいていリリースノートもない。今回は画面上の数字を動かしたために変更が見えたが、この種の変更の多くは見えない。仕事がモデルの挙動の一定性に依存しているなら、実務的な対応は自分用の小さな評価セットを持ち、定期的に走らせることだ。提供元のダッシュボードや、自分の「何かおかしい」という感覚に頼るのではなく。そして「モデルが劣化した」という投稿は慎重に扱ってほしい。時に正しいが、ほとんど証拠にはならない。
✓ 検証済み · 2ソース
アプリで読む——無料・9言語
関連ニュース
ManusはMetaから自社を買い戻した値の二倍の評価になった。
2026-10-08大会初日にハッカーがOpenAIのコーディング代理を破った。
2026-10-08最も安いものを求めた富裕層にAI代理人は高い案を勧めた。
2026-10-08開発者が一度も読まないままTypeScriptのコンパイラを公開した。
2026-10-08グーグルは打ち込んだ一文から遊べるゲームを組み立てる。
2026-10-08