aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-17

世界で最も多くの賞を受けた数学者二人が、AIが実際に何を解いているのかを見て、同じ欠落にたどり着いた

世界で最も多くの賞を受けた数学者二人が、AIが実際に何を解いているのかを見て、同じ欠落にたどり着いた

フィールズ賞受賞者のティモシー・ガワーズは8月12日、数学を言語モデルが得意な種類とそうでない種類に仕分けようとする記事を公開した。その結論は、既知の技法を組み合わせれば結果に到達できる領域でモデルは強く——反例探しが成果リストの中で異例なほど目立つ——探索空間が巨大なとき、そもそもどの方向が試す価値があるのかという判断では弱い、というものだ。彼はまだきれいな分類は存在しないと断ったうえで、理論家に形式化への協力を求めている。ピーター・サーナックは7月、米国数学会の Notices 誌で別の角度から似た地点に達した。AIは既存の理論から帰結を導けるが、大きな証明が通常その上に築かれる新しい抽象を発明することには苦労する、というものだ。DeepMindのトム・ザハヴィによる論文「LLMs Can't Jump」は、同じ隘路を技術的な言葉で、新しい基礎的仮定を立てられないこととして名指ししている。いずれも対照実験ではなく、実際の数学の仕事の中で道具がどう振る舞うかについての専門家の評価である。

なぜ重要かこれはもう一つのベンチマーク点数より有用な信号だ。ベンチマークが測っているのは、まさにこの数学者たちがモデルはすでに得意だと言っている事柄——目標が明示され道具が既知のときに隙間を埋めること——だからである。彼らが欠けていると指摘した部分、つまり何を試す価値があるかを決めることと、問題を扱えるものに変える概念を発明することは、答え合わせのできる設問の形では現れず、したがって評価にも現れない。同時にこれは、オリンピアードや競技会の成績を研究水準の能力の証拠として読むことへの戒めでもある。競技問題は構成上、既知の方法で解けるようにつくられているからだ。
#科学・研究

✓ 検証済み · 3ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

米国が16カ国を誘い、AIを科学の中心に置いた
2026-10-05
数学者が普通のチャット画面で未解決問題を五つ解いた
2026-10-05
素のモデルが、調整版には解けない課題を解いた。
2026-10-04
普通の写真で事前学習したモデルが推論テストで70%を取った
2026-10-04
グーグルが人工知能用半導体を軌道に送り、耐久性を試します。
2026-10-03