Исследования
AI Minute Newsroom
2026-08-23
Когда маленькая модель передаёт разговор большой, большая перечитывает всё заново. Nvidia утверждает, что перевод способна выполнить прямая линия.
Системы, которые начинают с дешёвой модели и переходят к более сильной, платят скрытый налог: принимающая модель перечитывает весь разговор с нуля — это шаг prefill, на который приходится большая часть стоимости длинного запроса. В статье на arXiv (2608.03893), привлёкшей на этой неделе широкое внимание, исследователи Nvidia сообщают, что внутренний кэш ключ-значение одной модели семейства отображается на другую обычной линейной регрессией — подобранной без градиентного спуска, по калибровочному набору всего из 500 последовательностей по 1024 токена; после снятия позиционного кодирования подгонка работает при любой длине контекста. Перенос кэша на 32 768 токенов занял 278 миллисекунд против примерно 7 секунд на повторный prefill, а на шести парах моделей из трёх семейств отображение оказалось быстрее перечитывания в 2,7–25 раз. Честная часть — в результатах: на четырёх парах из шести сохранялось от 73 до 98 процентов собственной точности принимающей модели, а две резко деградировали.
Почему это важноЭскалация — ответить малым, передать большому, когда вопрос усложняется, — это то, как на деле строится большинство серьёзных агентных систем, и сегодня такая передача означает платить за один и тот же контекст дважды. Если перевод между рабочей памятью двух моделей действительно близок к линейному, второй платёж почти исчезает. Две неудачные пары из шести — как раз причина читать это как исследовательский результат, а не как функцию продукта: метод требует, чтобы у обеих моделей совпадали число ключ-значение голов и размерность на голову, то есть одно семейство, и никто не показал, что он работает между разными производителями.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Модель на 27 миллиардов параметров обошла Opus 4.8 и GPT-5.5 в воспроизведении опубликованных статей
2026-08-23Дайте модели список литературы неопубликованной статьи и спросите, о чём статья. Лучшие угадывают в 15 процентах случаев.
2026-08-22Три четверти американцев не хотят дата-центр рядом с домом. Год назад мнения делились поровну.
2026-08-22Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.
2026-08-22Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21