aiminute. ← Все новости ИИ
Новые модели AI Minute Newsroom 2026-08-21

Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic

Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic

21 августа DeepSeek выложила на свою API-платформу экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. Это прежде чисто текстовая V4 Flash с добавленным пониманием изображений: компания утверждает, что по тексту — агенты, рассуждение, знание о мире — модель не уступает базовой, а на мультимодальных агентных бенчмарках совершает, по её словам, крупный скачок и приближается к Opus 4.8 от Anthropic. Задокументированные пределы необычно щедры: контекстное окно в 1 048 576 токенов, до 384 000 токенов на выходе, до 600 изображений в одном запросе и потолок тарификации в 384 токена на изображение. Модель принимает форматы API, совместимые и с OpenAI, и с Anthropic. OpenRouter, который описывает её как разреженную смесь экспертов с примерно 13 миллиардами активных параметров из 284 миллиардов, берёт 0,22 доллара за миллион входных токенов и 0,66 за миллион выходных. Bloomberg подал релиз как ход DeepSeek против лидерства Anthropic. Сравнение с Opus 4.8 — собственное утверждение DeepSeek, независимо оно пока не воспроизведено.

Почему это важноВажно здесь не то, что модель "умеет смотреть на картинки" — на картинки смотрит любая серьёзная модель. Важно, что она может посмотреть на скриншот и затем что-то с ним сделать: именно это требуется агенту, управляющему компьютером. DeepSeek говорит, что близка в этом к передовому уровню, беря центы за миллион токенов. Если независимые тесты подтвердят, стоимость создания агентов, читающих экран, резко упадёт для всех, кто не является крупной компанией, — и происходит это на той же неделе, когда Meta и OpenAI выпустили настольных ассистентов, следящих за вашим экраном. Оговорки заложены в названии и цене: "exp" означает экспериментальный, показатели бенчмарков принадлежат самому разработчику, а модель, рассчитанная читать 600 изображений за запрос, способна прочитать и 600 ваших скриншотов.
#Генерация изображений#ИИ-агенты

✓ Проверено · 4 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Новая модель Microsoft начинает писать ещё до того, как вы замолчали.
2026-10-05
OpenAI поставит рекламу рядом с картинками из ChatGPT.
2026-10-05
Американская лаборатория отдаст модель уровня китайских открытых.
2026-10-05
Помощник Meta ведёт почасовое дело на всех ваших знакомых.
2026-10-05
Два сенатора хотят тюрьму для шефов взламывающих ИИ-агентов.
2026-10-05