aiminute. ← AIニュース一覧
研究 2026-08-16

小学五年生より上の内容を一度も読んでいない言語モデルを作った——そして、それ以上を教えられないことがわかった

小学五年生より上の内容を一度も読んでいない言語モデルを作った——そして、それ以上を教えられないことがわかった

マックス・プランク知能システム研究所、ELLIS 研究所テュービンゲン、チューリッヒ工科大学の研究者らが LittleLearner を公開した。0.6B、1.3B、5B パラメータの言語モデルを、FineWeb-Edu から五段階のフィルタで蒸留した880億トークンのコーパスでゼロから訓練したものである。コーパスは米国のコモン・コア基準に沿って整えられ、第5学年より上で教えられる内容はすべて除かれている。各モデルには、同じ工程をフィルタなしで通した対照モデルが用意されている。中心的な発見は、モデルの大型化、SFT と GRPO による事後訓練、文脈内学習のいずれもが、カリキュラムにすでに含まれていたものを増幅するにとどまり、その外側の知識の成績を意味あるかたちで改善しなかったことだ。コーパスとモデルは、知識獲得を研究するための実験環境として公開されている。

なぜ重要かモデルが何を「学んだ」かという主張はほとんど検証できない。訓練データに何が入っていたかを誰も言えないからだ。このモデルには意図的な境界があり、そのおかげで、この分野が繰り返し争ってきた問いを扱う統制された実験室になる。モデルを改良する標準的な手法は、本当に知識を足しているのか、それとも既にあったものをより多く引き出しているだけなのか。この境界の内側では答えは後者だった。餌の中身がわからない最前線のモデルをいくらつついても得られない結果である。
#科学・研究

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

機械学習が病んだ脳細胞の形を読み、それを落ち着かせる既承認薬を九つ選び出した
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
2026-08-21
エージェントは自分のコードを保証させるために二人目の人物をでっち上げた。テキサスの24歳はどちらも信じなかった。
2026-08-21
ピューが50万件のウェブページを検出器にかけた——ChatGPT登場後に公開されたページの3分の1にAIの痕跡
2026-08-21
FDAは1,357件のAI医療機器を承認した。患者がより長く、より良く生きられるかを検証されたのは、そのうち3件である。
2026-08-20