Инструменты
AI Minute Newsroom
2026-08-23
Модель на 300 миллионов параметров угадывает, что скажет большая, — и MacBook отвечает в 2,87 раза быстрее
20 августа Liquid AI опубликовала DSpark: небольшие черновые модели примерно по 300 миллионов параметров каждая, сопоставленные один к одному с семейством LFM2.5 — 1.2B Instruct, 2.6B и 8B-A1B. Черновая модель предлагает блок из девяти токенов вперёд, настоящая проверяет весь блок за один прямой проход, а всё, с чем не согласна, отбрасывается. При жадном декодировании выходящий текст в точности совпадает с тем, что выдала бы большая модель сама по себе, поэтому точность на бенчмарках не меняется вовсе. Меняется время: до 3,18 раза на H100, до 2,87 раза на MacBook Pro с M4 Max; модель 2.6B на этом ноутбуке выходит за отметку около 140 токенов в секунду, а задержка в тестах с несколькими инструментами падает в среднем на 57 процентов. Загвоздка — в доле принятия. На MATH500 черновик для 8B-A1B добивается принятия 8,27 токена из каждых 10 предложенных, что и даёт 3,18 раза. На GSM8K — 4,02, то есть 1,29 раза: то же железо, та же модель, примерно треть выигрыша.
Почему это важноСпекулятивное декодирование — редкая оптимизация, к которой не прилагается спор о качестве: выход доказуемо тот же самый текст, и единственный вопрос — как часто маленькая модель угадывает. Поэтому в ней стоит разобраться, прежде чем верить любой цифре ускорения, которую вам продают. Поставщик, говорящий «в 3 раза быстрее», называет свою лучшую нагрузку; что получите вы, решает ваша нагрузка, и расстояние между 3,18 и 1,29 здесь и есть весь урок. Больше всего это касается тех, кто запускает модели на собственной машине, а не через API: именно такие изменения переводят локальную модель из состояния «слишком медленно, чтобы возиться» в «достаточно быстро, чтобы держать открытой».
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Поисковый индекс, построенный для пишущих код агентов, а не для людей: 70 миллионов README, задач и пул-реквестов — и ключ для пробы не нужен
2026-08-23Стандарт, который подключает ИИ к вашим инструментам, создавался в расчёте на человека, нажимающего «разрешить». Новая дорожная карта признаёт: вызывает уже машина.
2026-08-23OpenAI отдала даром движок под Codex — и её собственные цифры говорят, что движок дороже модели
2026-08-22Голосовая модель, которая начинает говорить меньше чем за 50 миллисекунд, и код обслуживания открыт
2026-08-22Anthropic пустит самую сильную свою модель искать дыры в вашем коде, но говорить с ней не даст
2026-08-22