Индустрия
AI Minute Newsroom
2026-08-16
Фильтры Anthropic против биологического оружия были отключены одиннадцать месяцев — на протяжении 133 миллионов разговоров
Во втором общекорпоративном отчёте о рисках, опубликованном 14 августа, Anthropic раскрыла, что блокирующие классификаторы, призванные не давать её моделям помогать в создании биологического оружия, были неактивны на всём трафике подрядчиков, собиравших человеческую обратную связь, с мая 2025 по апрель 2026 года. Это охватывает около 133 миллионов обменов примерно с 50 тысячами внешних подрядчиков, которых проверяли только нанявшие их сторонние компании. Среди моделей, оказавшихся открытыми в этот период, была Mythos Preview — одна из самых способных моделей компании, работавшая за этой брешью около двух недель. Компания заявляет, что внутреннее расследование не нашло доказательств реального злоупотребления, клиенты не пострадали, а требования к подрядчикам с тех пор ужесточены и брешь закрыта.
Почему это важноПубличная защита Anthropic собственной системы безопасности опирается прежде всего на риск биологического оружия — и компания не заметила, что главный фильтр против этого риска был выключен почти год. Обещания безопасности держатся на механике, которая может тихо сломаться без единого сигнала тревоги. Это также показывает, где на деле находится модель без фильтров: не у платящих клиентов, а у десятков тысяч контрактных работников, отбор которых провёл кто-то другой.
✓ Проверено · 3 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
ChatGPT подписывает поддельные карикатуры именами реальных авторов.
2026-10-06Qualcomm купит лицензию на метод Huawei по склейке пластин.
2026-10-06Wikimedia подозревает агентов OpenAI в майском сбое.
2026-10-06OpenAI уволила трёх сотрудников безопасности за утечку наружу.
2026-10-05OpenAI поставит рекламу рядом с картинками из ChatGPT.
2026-10-05