aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-22

未発表論文の参考文献リストだけを渡して、その論文が何を言っているか当てさせる。最良のモデルでも正答率は15%だ。

未発表論文の参考文献リストだけを渡して、その論文が何を言っているか当てさせる。最良のモデルでも正答率は15%だ。

Qingqing Mao氏らが8月17日にarXivへ投稿したReconstructionというベンチマークは、通常の推論評価より狭く、より難しいことを試す。モデルは発表前の参考文献だけから、その論文の中心的アイデアを導けるか。種となる論文は、同時期またはそれ以降に公開された一切とともに伏せられ、参考文献はタイトルを剥がされて匿名IDが振られる。そして別の言語モデルが、提案された仮説が本物と一致するかを判定する。6つの科学分野の643本の論文において、7つのフロンティアモデルが伏せられたアイデアを言い当てた割合はおよそ3%から15%だった。著者らは次に、同じモデル群を互いの仮説を査読させ、競合する枠についてスイス式トーナメントを回すパイプラインに組み込んだ。これにより一致率はおよそ23%から42%へ、最良の単体モデルの約2.4倍に上がった。

なぜ重要かモデルが文献タスクで好成績を出したとき、説明は二通りありうる。分野を理解したのか、答えをすでに読んでいたのか。このベンチマークは二つ目の説明を消すために設計されており、残ったものは小さい。その差こそ、優れた研究助手と研究者の違いであり、各研究所が自社のシステムを科学者と呼ぶあいだ、覚えておく価値がある。ただし結果の後半のほうが有用だ。同じウェイトを、自分自身と議論する形に並べ替えるだけでスコアは2倍以上になった。今週これで2度目、見出しの数字はモデルではなくその周りの足場から出てきた。
#AIエージェント#科学・研究

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

OpenAIの新しいAPIが150ミリ秒で選択肢を一つ選ぶ。
2026-10-07
エルデシュ問題のサイトが証明の投稿を止めた。
2026-10-07
同じ仕事を二十回やらせると最高の人工知能の点が三分の一落ちた。
2026-10-06
すべてのAIを訓練する方法を使わずに、モデルが学びました。
2026-10-06
TikTokが見ている動画の中に買い物ボットを入れました。
2026-10-06