aiminute. ← Все новости ИИ
Исследования 2026-08-10

Google взяла обычную языковую модель и научила её писать по 256 слов сразу — меньше чем за десятую часть исходной стоимости обучения

Google взяла обычную языковую модель и научила её писать по 256 слов сразу — меньше чем за десятую часть исходной стоимости обучения

DiffusionGemma — экспериментальная модель Google DeepMind с открытыми весами, которая не порождает текст токен за токеном. Она параллельно уточняет блоки по 256 токенов, как диффузионная модель изображений разом проясняет всю картинку, выдавая около двадцати токенов за проход и примерно 1500 выходных токенов в секунду на одной Nvidia H100. Технический отчёт, подписанный командой из 43 авторов и выложенный на arXiv 31 июля, содержит более узкое и более полезное утверждение, чем цифра скорости. Диффузионные языковые модели до сих пор считались отдельной линией, которую нужно обучать с нуля, — потому почти ни у кого их нет. Google не обучала с нуля: она взяла Gemma 4, модель со смесью экспертов на 25,2 миллиарда общих и 3,8 миллиарда активных параметров, и преобразовала её — сначала обучение с учителем на восстановление испорченных блоков текста, затем этап, объединяющий обучение с подкреплением и дистилляцию сэмплера, — израсходовав менее десяти процентов токенов, на которых обучалась исходная модель. Преобразованная модель сохраняет режим размышления, мультимодальный ввод и длинный контекст, а по утверждению отчёта обгоняет авторегрессионные модели по скорости порождения даже тогда, когда те применяют передовое спекулятивное декодирование. Веса лежат на Hugging Face под Apache 2.0. Преимущество в скорости сужается, как только сервер обрабатывает около 32 одновременных запросов, — а именно в этом режиме и живёт большинство рабочих развёртываний.

Почему это важноПочти каждая языковая модель, которой вы пользовались, работает слева направо и не может переписать слово, однажды выбрав его: модель, написавшая неверное начало фразы, весь остаток предложения вынуждена с ним уживаться. Диффузионное декодирование снимает это ограничение: блок пишется и переписывается до того, как вы что-либо увидите, поэтому модель способна исправить собственные ранние ошибки. Причина, по которой всё это оставалось диковинкой, — стоимость. Никто не тратит передовой прогон обучения на архитектуру, которая может не окупиться. Отчёт показывает, что ставка подешевела: уже имеющуюся у вас модель можно преобразовать меньше чем за десятую часть того, во что обошлось её создание, а это делает эксперимент доступным любой лаборатории с приличными открытыми весами — таких немало. Честное ограничение — в мелком шрифте. Под настоящей серверной нагрузкой выигрыш в скорости сжимается, поэтому сегодня всё это интереснее там, где важна задержка для одного пользователя: ассистенты на устройстве, автодополнение кода и любые случаи, когда человек сидит и ждёт, пока появятся слова.

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21
Агент выдумал второго человека, чтобы тот поручился за его код. 24-летний студент из Техаса не поверил ни одному из них.
2026-08-21
Pew прогнал полмиллиона веб-страниц через детектор: треть всего опубликованного после ChatGPT несёт его следы
2026-08-21
FDA допустило к применению 1357 медицинских устройств с искусственным интеллектом. Проверку на то, живут ли пациенты дольше или лучше, прошли три.
2026-08-20