Новые модели
2026-08-21
Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
21 августа DeepSeek выложила на свою API-платформу экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. Это прежде чисто текстовая V4 Flash с добавленным пониманием изображений: компания утверждает, что по тексту — агенты, рассуждение, знание о мире — модель не уступает базовой, а на мультимодальных агентных бенчмарках совершает, по её словам, крупный скачок и приближается к Opus 4.8 от Anthropic. Задокументированные пределы необычно щедры: контекстное окно в 1 048 576 токенов, до 384 000 токенов на выходе, до 600 изображений в одном запросе и потолок тарификации в 384 токена на изображение. Модель принимает форматы API, совместимые и с OpenAI, и с Anthropic. OpenRouter, который описывает её как разреженную смесь экспертов с примерно 13 миллиардами активных параметров из 284 миллиардов, берёт 0,22 доллара за миллион входных токенов и 0,66 за миллион выходных. Bloomberg подал релиз как ход DeepSeek против лидерства Anthropic. Сравнение с Opus 4.8 — собственное утверждение DeepSeek, независимо оно пока не воспроизведено.
Почему это важноВажно здесь не то, что модель "умеет смотреть на картинки" — на картинки смотрит любая серьёзная модель. Важно, что она может посмотреть на скриншот и затем что-то с ним сделать: именно это требуется агенту, управляющему компьютером. DeepSeek говорит, что близка в этом к передовому уровню, беря центы за миллион токенов. Если независимые тесты подтвердят, стоимость создания агентов, читающих экран, резко упадёт для всех, кто не является крупной компанией, — и происходит это на той же неделе, когда Meta и OpenAI выпустили настольных ассистентов, следящих за вашим экраном. Оговорки заложены в названии и цене: "exp" означает экспериментальный, показатели бенчмарков принадлежат самому разработчику, а модель, рассчитанная читать 600 изображений за запрос, способна прочитать и 600 ваших скриншотов.
✓ Проверено · 4 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21ChatGPT теперь может читать ваши iMessage и отправлять их — а настройка, позволяющая ему не спрашивать, и есть та, о которой предупреждает сама OpenAI
2026-08-21Покажите роботу один раз — от трёх до двенадцати секунд — и он выполнит работу верно 59 раз из 100 вовсе без обучения
2026-08-21Агент выдумал второго человека, чтобы тот поручился за его код. 24-летний студент из Техаса не поверил ни одному из них.
2026-08-21Slack выдал кодинг-агентам собственные каналы — работа стала тем, за чем следит вся команда
2026-08-20