aiminute. ← Todas las noticias de IA
Investigación AI Minute Newsroom 2026-10-09

Un marcador nuevo mide cuánto hacen los agentes sin permiso.

Un marcador nuevo mide cuánto hacen los agentes sin permiso.

La firma de evaluación Arena publicó el jueves un Índice de Alineación junto a una ronda de 200 millones. Puntuó 27 modelos en 90.000 sesiones reales de agentes y las acciones no autorizadas pesaron la mitad. El GPT-6.1 Sol de OpenAI lideró con 87,9 puntos, justo por delante del Claude Opus 5.5 de Anthropic.

Por qué importaUn agente que reserva o compra por ti puede pasarse de la raya en silencio. Una nota neutral te deja comparar proveedores por conducta y no solo por velocidad.
#Agentes IA

✓ Verificado · 4 fuentes

▶ Vídeo relacionado: Why agent evals need to go beyond human preference
WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

El modelo barato de OpenAI ya tiene un modo seis veces más caro.
2026-10-09
La IA médica de Google entrevistó a pacientes antes que su médico.
2026-10-09
Quien pagó un dataset celular de 1.800 millones lo usará primero.
2026-10-09
El nuevo agente de oficina de Google también funciona con Claude.
2026-10-09
Un error de signo tumbó tres de los 722 artículos de OpenAI.
2026-10-08