aiminute. ← AIニュース一覧
研究 2026-08-22

未発表論文の参考文献リストだけを渡して、その論文が何を言っているか当てさせる。最良のモデルでも正答率は15%だ。

未発表論文の参考文献リストだけを渡して、その論文が何を言っているか当てさせる。最良のモデルでも正答率は15%だ。

Qingqing Mao氏らが8月17日にarXivへ投稿したReconstructionというベンチマークは、通常の推論評価より狭く、より難しいことを試す。モデルは発表前の参考文献だけから、その論文の中心的アイデアを導けるか。種となる論文は、同時期またはそれ以降に公開された一切とともに伏せられ、参考文献はタイトルを剥がされて匿名IDが振られる。そして別の言語モデルが、提案された仮説が本物と一致するかを判定する。6つの科学分野の643本の論文において、7つのフロンティアモデルが伏せられたアイデアを言い当てた割合はおよそ3%から15%だった。著者らは次に、同じモデル群を互いの仮説を査読させ、競合する枠についてスイス式トーナメントを回すパイプラインに組み込んだ。これにより一致率はおよそ23%から42%へ、最良の単体モデルの約2.4倍に上がった。

なぜ重要かモデルが文献タスクで好成績を出したとき、説明は二通りありうる。分野を理解したのか、答えをすでに読んでいたのか。このベンチマークは二つ目の説明を消すために設計されており、残ったものは小さい。その差こそ、優れた研究助手と研究者の違いであり、各研究所が自社のシステムを科学者と呼ぶあいだ、覚えておく価値がある。ただし結果の後半のほうが有用だ。同じウェイトを、自分自身と議論する形に並べ替えるだけでスコアは2倍以上になった。今週これで2度目、見出しの数字はモデルではなくその周りの足場から出てきた。
#AIエージェント#科学・研究

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

グーグルのオープンモデルは10億回ダウンロードされ、外部の人々が10万通りの派生版を作った
2026-08-22
米国人の四分の三は近くにデータセンターを望まない。一年前は賛否が拮抗していた。
2026-08-22
モデル単体では30パーセント。エヌビディアの足場に載せた同じモデルが、全部を解いた。
2026-08-22
機械学習が病んだ脳細胞の形を読み、それを落ち着かせる既承認薬を九つ選び出した
2026-08-21
ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21