Recherche
2026-08-22
Donnez à un modèle la bibliographie d'un article non publié et demandez-lui ce que dit l'article. Les meilleurs trouvent 15 pour cent du temps.
Un banc d'essai nommé Reconstruction, déposé sur arXiv le 17 août par Qingqing Mao et ses collègues, teste quelque chose de plus étroit et de plus dur que les évaluations de raisonnement habituelles : un modèle peut-il déduire l'idée centrale d'un article à partir de sa seule bibliographie antérieure à la publication ? L'article source est retiré, avec tout ce qui a été publié au même moment ou après, les références sont dépouillées de leur titre et reçoivent un identifiant anonyme, et un autre modèle de langage juge si l'hypothèse proposée correspond à la vraie. Sur 643 articles dans six domaines scientifiques, sept modèles de pointe ont retrouvé l'idée dissimulée entre 3 et 15 pour cent du temps environ. Les auteurs ont ensuite branché ces mêmes modèles sur une chaîne où ils examinent mutuellement leurs hypothèses et s'affrontent en tournoi au système suisse sur des créneaux concurrents ; le taux est monté à 23 à 42 pour cent environ, soit près de 2,4 fois le meilleur modèle seul.
Pourquoi c'est importantTout ce qu'un modèle réussit sur une tâche bibliographique admet deux explications : il a compris le domaine, ou il a déjà lu la réponse. Ce banc d'essai est bâti précisément pour supprimer la seconde, et ce qui reste est mince. Cet écart, c'est la différence entre un excellent assistant de recherche et un chercheur, et il vaut la peine de le garder en tête pendant que les laboratoires décrivent leurs systèmes comme des scientifiques. La seconde moitié du résultat est toutefois la plus utile : les mêmes poids, agencés pour débattre avec eux-mêmes, ont plus que doublé le score. C'est la deuxième fois cette semaine que le chiffre de une vient de l'échafaudage et non du modèle.
✓ Vérifié · 2 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Les modèles ouverts de Google ont été téléchargés un milliard de fois, et l'extérieur en a fabriqué 100 000 versions
2026-08-22Trois quarts des Américains ne veulent pas de centre de données près de chez eux. Il y a un an, ils étaient partagés à égalité.
2026-08-22Le modèle seul obtenait 30 pour cent. Enveloppé dans l'échafaudage de Nvidia, le même modèle a tout franchi.
2026-08-22L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21