aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-08-23

Когда маленькая модель передаёт разговор большой, большая перечитывает всё заново. Nvidia утверждает, что перевод способна выполнить прямая линия.

Когда маленькая модель передаёт разговор большой, большая перечитывает всё заново. Nvidia утверждает, что перевод способна выполнить прямая линия.

Системы, которые начинают с дешёвой модели и переходят к более сильной, платят скрытый налог: принимающая модель перечитывает весь разговор с нуля — это шаг prefill, на который приходится большая часть стоимости длинного запроса. В статье на arXiv (2608.03893), привлёкшей на этой неделе широкое внимание, исследователи Nvidia сообщают, что внутренний кэш ключ-значение одной модели семейства отображается на другую обычной линейной регрессией — подобранной без градиентного спуска, по калибровочному набору всего из 500 последовательностей по 1024 токена; после снятия позиционного кодирования подгонка работает при любой длине контекста. Перенос кэша на 32 768 токенов занял 278 миллисекунд против примерно 7 секунд на повторный prefill, а на шести парах моделей из трёх семейств отображение оказалось быстрее перечитывания в 2,7–25 раз. Честная часть — в результатах: на четырёх парах из шести сохранялось от 73 до 98 процентов собственной точности принимающей модели, а две резко деградировали.

Почему это важноЭскалация — ответить малым, передать большому, когда вопрос усложняется, — это то, как на деле строится большинство серьёзных агентных систем, и сегодня такая передача означает платить за один и тот же контекст дважды. Если перевод между рабочей памятью двух моделей действительно близок к линейному, второй платёж почти исчезает. Две неудачные пары из шести — как раз причина читать это как исследовательский результат, а не как функцию продукта: метод требует, чтобы у обеих моделей совпадали число ключ-значение голов и размерность на голову, то есть одно семейство, и никто не показал, что он работает между разными производителями.

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Модель на 27 миллиардов параметров обошла Opus 4.8 и GPT-5.5 в воспроизведении опубликованных статей
2026-08-23
Дайте модели список литературы неопубликованной статьи и спросите, о чём статья. Лучшие угадывают в 15 процентах случаев.
2026-08-22
Три четверти американцев не хотят дата-центр рядом с домом. Год назад мнения делились поровну.
2026-08-22
Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.
2026-08-22
Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21