aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-09-02

Anthropic нашла ошибки более чем в десятой части своих сред обучения.

Anthropic нашла ошибки более чем в десятой части своих сред обучения.

Anthropic опубликовала 31 августа разбор своей работы по согласованию и безопасности. Более 10 процентов сред обучения с подкреплением оказались сломанными или уязвимыми к взлому награды. Компания заморозила изменения на месяц и перевела 150 инженеров в безопасность.

Почему это важноМодели набирают привычки именно в этих тренировочных средах, а сломанная учит неверному. Лаборатория редко пересчитывает собственные промахи публично.

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Следующая модель OpenAI думает петлями почти без следов.
2026-09-03
Perplexity ссылается на 215 128 гайдов с трёх связанных сайтов.
2026-09-02
Разработчик обошёл многие чат-боты в тесте за 67 центов.
2026-09-02
Лучший ИИ-агент выполнил 30% реальной лабораторной работы
2026-08-29
Claude обошёл людей-исследователей в закрытии дыр выравнивания
2026-08-29