aiminute. ← Alle KI-News
Neue Modelle AI Minute Newsroom 2026-08-21

DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein

DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein

DeepSeek stellte am 21. August ein experimentelles multimodales Modell namens DeepSeek-V4-Flash-Vision-Exp auf seine API-Plattform. Es ist das bisher reine Text-Modell V4 Flash, ergänzt um Bildverständnis: Nach Angaben des Unternehmens erreicht es im Text — Agenten, Schlussfolgern, Weltwissen — das Niveau des Basismodells und macht bei multimodalen Agenten-Benchmarks einen nach eigener Darstellung großen Sprung, der es nahe an Anthropics Opus 4.8 bringt. Die dokumentierten Grenzen sind ungewöhnlich großzügig: ein Kontextfenster von 1.048.576 Token, bis zu 384.000 Token Ausgabe, bis zu 600 Bilder in einer einzigen Anfrage und eine Abrechnungsobergrenze von 384 Token je Bild. Es akzeptiert sowohl OpenAI- als auch Anthropic-kompatible API-Formate. OpenRouter, das es als Sparse-Mixture-of-Experts-Modell mit rund 13 Milliarden aktiven von 284 Milliarden Parametern führt, verlangt 0,22 Dollar je Million Eingabe-Token und 0,66 Dollar je Million Ausgabe-Token. Bloomberg deutete die Veröffentlichung als DeepSeeks Zug gegen Anthropics Vorsprung. Der Vergleich mit Opus 4.8 ist DeepSeeks eigene Behauptung und wurde bislang nicht unabhängig nachvollzogen.

Warum es wichtig istEntscheidend ist hier nicht, dass es "Bilder anschauen kann" — das kann jedes ernstzunehmende Modell. Entscheidend ist, dass es einen Screenshot ansehen und anschließend etwas damit tun kann; genau das muss ein Agent leisten, der einen Computer bedient. DeepSeek sagt, es sei darin nahe an der Spitze, und verlangt dafür Cent-Beträge je Million Token. Bestätigen unabhängige Tests das, sinken die Kosten für bildschirmlesende Agenten für alle, die kein Großkonzern sind, deutlich — und zwar in derselben Woche, in der Meta und OpenAI Desktop-Assistenten veröffentlicht haben, die den Bildschirm mitlesen. Die Vorbehalte stecken im Namen und im Preis: "exp" heißt experimentell, die Benchmark-Angaben stammen vom Anbieter selbst, und ein Modell, das 600 Bilder pro Anfrage lesen soll, kann auch 600 Ihrer Screenshots lesen.
#Bildgenerierung#KI-Agenten

✓ Verifiziert · 4 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Microsofts neues Modell schreibt, bevor Sie fertig gesprochen haben.
2026-10-05
OpenAI setzt Werbung direkt neben die Bilder von ChatGPT.
2026-10-05
Ein US-Labor verschenkt bald ein Modell auf Chinas Niveau.
2026-10-05
Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05
Zwei Senatoren wollen Haft für Chefs hackender KI-Agenten.
2026-10-05