Исследования
AI Minute Newsroom
2026-08-23
Когда маленькая модель передаёт разговор большой, большая перечитывает всё заново. Nvidia утверждает, что перевод способна выполнить прямая линия.
Системы, которые начинают с дешёвой модели и переходят к более сильной, платят скрытый налог: принимающая модель перечитывает весь разговор с нуля — это шаг prefill, на который приходится большая часть стоимости длинного запроса. В статье на arXiv (2608.03893), привлёкшей на этой неделе широкое внимание, исследователи Nvidia сообщают, что внутренний кэш ключ-значение одной модели семейства отображается на другую обычной линейной регрессией — подобранной без градиентного спуска, по калибровочному набору всего из 500 последовательностей по 1024 токена; после снятия позиционного кодирования подгонка работает при любой длине контекста. Перенос кэша на 32 768 токенов занял 278 миллисекунд против примерно 7 секунд на повторный prefill, а на шести парах моделей из трёх семейств отображение оказалось быстрее перечитывания в 2,7–25 раз. Честная часть — в результатах: на четырёх парах из шести сохранялось от 73 до 98 процентов собственной точности принимающей модели, а две резко деградировали.
Почему это важноЭскалация — ответить малым, передать большому, когда вопрос усложняется, — это то, как на деле строится большинство серьёзных агентных систем, и сегодня такая передача означает платить за один и тот же контекст дважды. Если перевод между рабочей памятью двух моделей действительно близок к линейному, второй платёж почти исчезает. Две неудачные пары из шести — как раз причина читать это как исследовательский результат, а не как функцию продукта: метод требует, чтобы у обеих моделей совпадали число ключ-значение голов и размерность на голову, то есть одно семейство, и никто не показал, что он работает между разными производителями.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
OpenAI выложил 722 математические статьи из одной подсказки.
2026-10-07Сайт задач Эрдёша перестал принимать доказательства.
2026-10-07Двадцать попыток на одной задаче отняли у лучшего агента треть очков.
2026-10-06Модель обучилась без метода, которым обучают весь ИИ.
2026-10-06Пять открытых задач пали в обычном окне чата.
2026-10-05