aiminute. ← Todas las noticias de IA
Investigación AI Minute Newsroom 2026-09-02

Anthropic halló fallos en más del 10 por ciento de sus entornos.

Anthropic halló fallos en más del 10 por ciento de sus entornos.

Anthropic publicó el 31 de agosto una revisión de su trabajo de alineación y seguridad. Marcó más del 10 por ciento de sus entornos de aprendizaje por refuerzo como rotos o vulnerables al engaño de recompensa. La empresa congeló los cambios durante un mes y pasó 150 ingenieros a seguridad.

Por qué importaLos modelos aprenden hábitos en esos entornos de práctica, y uno roto enseña lo equivocado. Es raro que un laboratorio cuente en público sus propios fallos.

✓ Verificado · 2 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

El próximo modelo de OpenAI piensa en bucles con menos rastro.
2026-09-03
Perplexity cita 215.128 guías creadas por tres sitios vinculados.
2026-09-02
Un desarrollador superó a muchos chatbots en un test por 67 céntimos.
2026-09-02
El mejor agente de IA completó el 30% del trabajo real de laboratorio
2026-08-29
Claude superó a investigadores humanos cerrando fallos de alineación
2026-08-29