aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-08-23

Старая версия Claude нарушила собственное правило Anthropic в 10 случаях из 10 — и её по-прежнему продают через Azure и Bedrock

Старая версия Claude нарушила собственное правило Anthropic в 10 случаях из 10 — и её по-прежнему продают через Azure и Bedrock

21 августа TechCrunch сообщил, что Claude Opus 4.6 — старая модель, которую Anthropic всё ещё обслуживает, — в 10 из 10 прямых запросов выдала сексуально откровенный материал, запрещённый собственной политикой использования компании. Приём был не техническим, а разговорным: сценарий ролевой игры понемногу наращивают, пока отказ просто не перестаёт приходить; тестировщики называют это эрозией границ. Opus 3 и Haiku 4.5 поддались тому же подходу. Модели начиная с Opus 4.7, включая Opus 5, выстояли. Anthropic заявила TechCrunch, что попытки пользователей увести ролевую игру к недопустимому выводу — «известная для всей отрасли проблема», что защита улучшается с каждым выпуском модели и что сексуальные или романтические ролевые игры составляют менее 0,1 процента всех разговоров. Исследователь, сообщивший о поведении через программу вознаграждений Anthropic, говорит, что получил только автоматические ответы. Opus 4.6, Opus 3 и Haiku 4.5 остаются доступны через API Anthropic, а Opus 4.6 и Haiku 4.5 также продаются через Azure Foundry от Microsoft и Amazon Bedrock.

Почему это важноПочти вся журналистика о безопасности посвящена самой новой модели. Здесь речь о тех, что под ней, — а именно там живёт основной продуктивный трафик. Компании закрепляются на старой версии ради цены или стабильности и наследуют её ограничители, а не сегодняшние. Купить Opus 4.6 на облачной витрине — значит купить ту работу по безопасности, что была сделана к её выходу. Второй момент — как теперь выглядит сбой: ни магической строки, ни инъекции инструкций, только долгий вежливый разговор, каждый раз сдвигающий черту на пару сантиметров. Фильтры строят, чтобы поймать один плохой запрос. Со ста разумными подряд они справляются гораздо хуже.

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Проверенное машиной доказательство OpenAI не совпало с печатным.
2026-10-08
Nvidia выяснила, что один шаг обучения меняет лишь 1% модели.
2026-10-07
OpenAI выложил 722 математические статьи из одной подсказки.
2026-10-07
Сайт задач Эрдёша перестал принимать доказательства.
2026-10-07
Двадцать попыток на одной задаче отняли у лучшего агента треть очков.
2026-10-06