Исследования
2026-08-22
Дайте модели список литературы неопубликованной статьи и спросите, о чём статья. Лучшие угадывают в 15 процентах случаев.
Бенчмарк Reconstruction, выложенный на arXiv 17 августа Qingqing Mao и коллегами, проверяет нечто более узкое и сложное, чем обычные оценки рассуждений: способна ли модель вывести центральную идею статьи из одного лишь её допубликационного списка литературы? Исходная статья скрыта вместе со всем, что вышло одновременно или позже, у ссылок убраны названия и присвоены анонимные идентификаторы, а отдельная языковая модель судит, совпадает ли предложенная гипотеза с настоящей. На 643 статьях из шести научных областей семь передовых моделей попадали в скрытую идею примерно в 3-15 процентах случаев. Затем авторы соединили те же модели в конвейер, где они рецензируют гипотезы друг друга и разыгрывают турнир по швейцарской системе за конкурирующие места; это подняло долю совпадений примерно до 23-42 процентов, около 2,4 раза от лучшей одиночной модели.
Почему это важноУ любого хорошего результата модели в работе с литературой есть два объяснения: она поняла область или она уже прочла ответ. Этот бенчмарк построен именно для того, чтобы снять второе объяснение, и остаётся немного. Этот разрыв и есть разница между отличным научным ассистентом и исследователем, и о нём стоит помнить, пока лаборатории называют свои системы учёными. Но полезнее вторая половина результата: те же веса, выстроенные в спор с самими собой, более чем удвоили показатель. Это уже второй раз за неделю, когда заголовочная цифра приходит из обвязки, а не из модели.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Открытые модели Google скачали миллиард раз, а сторонние разработчики собрали из них 100 000 версий
2026-08-22Три четверти американцев не хотят дата-центр рядом с домом. Год назад мнения делились поровну.
2026-08-22Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.
2026-08-22Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21