Nuevos Modelos
2026-08-21
El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
DeepSeek publicó el 21 de agosto en su plataforma de API un modelo multimodal experimental, DeepSeek-V4-Flash-Vision-Exp. Es el V4 Flash, hasta ahora solo de texto, con comprensión de imágenes añadida: la empresa afirma que iguala al modelo base en texto — agentes, razonamiento, conocimiento del mundo — mientras da lo que llama un salto importante en pruebas de agentes multimodales, acercándose al Opus 4.8 de Anthropic. Los límites documentados son inusualmente generosos: una ventana de contexto de 1.048.576 tokens, hasta 384.000 tokens de salida, hasta 600 imágenes en una sola petición y un tope de facturación de 384 tokens por imagen. Acepta formatos de API compatibles tanto con OpenAI como con Anthropic. OpenRouter, que lo describe como un modelo de mezcla dispersa de expertos con unos 13.000 millones de parámetros activos de 284.000 millones, lo cobra a 0,22 dólares por millón de tokens de entrada y 0,66 por millón de salida. Bloomberg presentó el lanzamiento como el movimiento de DeepSeek frente a la ventaja de Anthropic. La comparación con Opus 4.8 es una afirmación de la propia DeepSeek y todavía no se ha reproducido de forma independiente.
Por qué importaLo relevante aquí no es que "pueda mirar imágenes": cualquier modelo serio mira imágenes. Lo relevante es que pueda mirar una captura de pantalla y después hacer algo con ella, que es exactamente lo que debe hacer un agente que maneja un ordenador, y DeepSeek dice estar cerca de la frontera en eso cobrando céntimos por millón de tokens. Si las pruebas independientes lo confirman, el coste de construir agentes que leen pantallas cae bruscamente para todo el que no sea una gran empresa, y llega la misma semana en que Meta y OpenAI lanzaron asistentes de escritorio que miran tu pantalla. Las advertencias están en el nombre y en el precio: "exp" significa experimental, las cifras de referencia son del propio fabricante y un modelo diseñado para leer 600 imágenes por petición es también un modelo capaz de leer 600 capturas suyas.
✓ Verificado · 4 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21ChatGPT ya puede leer tus iMessages y enviarlos — y el ajuste que le permite dejar de preguntar es justo el que OpenAI advierte
2026-08-21Enséñaselo al robot una vez — de tres a doce segundos — y acierta 59 veces de cada 100 sin ningún entrenamiento
2026-08-21El agente se inventó a una segunda persona para avalar su código. Un joven de 24 años en Texas no creyó a ninguno de los dos.
2026-08-21Slack ha dado a los agentes de programación sus propios canales: ahora el trabajo es algo que todo el equipo ve suceder
2026-08-20