aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-09-02

Plus d'un dixième des entraînements d'Anthropic étaient défectueux.

Plus d'un dixième des entraînements d'Anthropic étaient défectueux.

Anthropic a publié le 31 août un bilan de son travail d'alignement et de sécurité. Plus de 10 pour cent de ses environnements d'apprentissage par renforcement étaient cassés ou piratables par la récompense. L'entreprise a gelé les changements un mois et déplacé 150 ingénieurs vers la sécurité.

Pourquoi c'est importantLes modèles prennent leurs habitudes dans ces environnements d'entraînement, et un environnement cassé enseigne le faux. Il est rare qu'un laboratoire compte ses propres défauts en public.

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le prochain modèle d'OpenAI pense en boucles peu lisibles.
2026-09-03
Perplexity cite 215 128 guides produits par trois sites liés.
2026-09-02
Un développeur a battu bien des modèles pour 67 centimes de calcul.
2026-09-02
Le meilleur agent IA a terminé 30% du vrai travail de laboratoire
2026-08-29
Claude a battu des chercheurs humains sur les failles d'alignement
2026-08-29