Forschung
2026-08-22
Gib einem Modell das Literaturverzeichnis eines unveröffentlichten Papiers und frage, was darin steht. Die besten treffen in 15 Prozent der Fälle.
Ein Benchmark namens Reconstruction, am 17. August von Qingqing Mao und Kollegen auf arXiv gestellt, prüft etwas Engeres und Härteres als übliche Reasoning-Evaluationen: Kann ein Modell die zentrale Idee eines Papiers allein aus dessen Literaturverzeichnis vor der Veröffentlichung erschließen? Das Ausgangspapier wird zurückgehalten, zusammen mit allem, was zeitgleich oder später erschien, den Referenzen werden die Titel entzogen und anonyme Kennungen zugeteilt, und ein separates Sprachmodell beurteilt, ob die vorgeschlagene Hypothese der echten entspricht. Über 643 Papiere aus sechs wissenschaftlichen Feldern trafen sieben Spitzenmodelle die zurückgehaltene Idee in etwa 3 bis 15 Prozent der Fälle. Anschließend verschalteten die Autoren dieselben Modelle zu einer Pipeline, in der sie die Hypothesen der anderen begutachten und in einem Turnier nach Schweizer System um konkurrierende Plätze antreten; das hob die Trefferquote auf rund 23 bis 42 Prozent, etwa das 2,4-Fache des besten Einzelmodells.
Warum es wichtig istAlles, was ein Modell bei einer Literaturaufgabe gut macht, lässt zwei Erklärungen zu: Es hat das Feld verstanden, oder es hat die Antwort schon gelesen. Dieser Benchmark ist eigens gebaut, um die zweite Erklärung zu entfernen, und was übrig bleibt, ist wenig. Diese Lücke ist der Unterschied zwischen einem exzellenten Forschungsassistenten und einem Forscher, und man sollte sie im Kopf behalten, während Labore ihre Systeme als Wissenschaftler beschreiben. Nützlicher ist allerdings die zweite Hälfte des Ergebnisses: Dieselben Gewichte, zu einer Auseinandersetzung mit sich selbst angeordnet, verdoppelten den Wert mehr als. Damit kam diese Woche zum zweiten Mal die Schlagzeilenzahl aus dem Gerüst statt aus dem Modell.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Googles offene Modelle wurden eine Milliarde Mal heruntergeladen, und Außenstehende haben 100.000 Versionen daraus gebaut
2026-08-22Drei Viertel der Amerikaner wollen kein Rechenzentrum in ihrer Nähe. Vor einem Jahr war das Land noch geteilt.
2026-08-22Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.
2026-08-22Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21