aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-08-22

Gib einem Modell das Literaturverzeichnis eines unveröffentlichten Papiers und frage, was darin steht. Die besten treffen in 15 Prozent der Fälle.

Gib einem Modell das Literaturverzeichnis eines unveröffentlichten Papiers und frage, was darin steht. Die besten treffen in 15 Prozent der Fälle.

Ein Benchmark namens Reconstruction, am 17. August von Qingqing Mao und Kollegen auf arXiv gestellt, prüft etwas Engeres und Härteres als übliche Reasoning-Evaluationen: Kann ein Modell die zentrale Idee eines Papiers allein aus dessen Literaturverzeichnis vor der Veröffentlichung erschließen? Das Ausgangspapier wird zurückgehalten, zusammen mit allem, was zeitgleich oder später erschien, den Referenzen werden die Titel entzogen und anonyme Kennungen zugeteilt, und ein separates Sprachmodell beurteilt, ob die vorgeschlagene Hypothese der echten entspricht. Über 643 Papiere aus sechs wissenschaftlichen Feldern trafen sieben Spitzenmodelle die zurückgehaltene Idee in etwa 3 bis 15 Prozent der Fälle. Anschließend verschalteten die Autoren dieselben Modelle zu einer Pipeline, in der sie die Hypothesen der anderen begutachten und in einem Turnier nach Schweizer System um konkurrierende Plätze antreten; das hob die Trefferquote auf rund 23 bis 42 Prozent, etwa das 2,4-Fache des besten Einzelmodells.

Warum es wichtig istAlles, was ein Modell bei einer Literaturaufgabe gut macht, lässt zwei Erklärungen zu: Es hat das Feld verstanden, oder es hat die Antwort schon gelesen. Dieser Benchmark ist eigens gebaut, um die zweite Erklärung zu entfernen, und was übrig bleibt, ist wenig. Diese Lücke ist der Unterschied zwischen einem exzellenten Forschungsassistenten und einem Forscher, und man sollte sie im Kopf behalten, während Labore ihre Systeme als Wissenschaftler beschreiben. Nützlicher ist allerdings die zweite Hälfte des Ergebnisses: Dieselben Gewichte, zu einer Auseinandersetzung mit sich selbst angeordnet, verdoppelten den Wert mehr als. Damit kam diese Woche zum zweiten Mal die Schlagzeilenzahl aus dem Gerüst statt aus dem Modell.
#KI-Agenten#Wissenschaft & Forschung

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

OpenAIs neue Schnittstelle wählt in 150 Millisekunden eine Antwort.
2026-10-07
Die Erdős-Problemseite nimmt keine Beweise mehr an.
2026-10-07
Zwanzig Versuche kosteten den besten Agenten ein Drittel der Punkte.
2026-10-06
Ein Modell lernte ohne das Verfahren, das jede KI trainiert.
2026-10-06
TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06