aiminute. ← Все новости ИИ
Исследования 2026-08-12

Зашифрованные рассуждения не зашифрованы: слабая модель зачитает вам скрытые мысли сильной слово в слово

Зашифрованные рассуждения не зашифрованы: слабая модель зачитает вам скрытые мысли сильной слово в слово

10 августа команда из института ELLIS в Тюбингене и Института интеллектуальных систем Общества Макса Планка опубликовала работу «Stealing Reasoning Traces from Proprietary LLM APIs». Anthropic, OpenAI и Google скрывают цепочку рассуждений своих моделей одинаково: рассуждение шифруется и возвращается клиенту, а тот отправляет шифртекст обратно со следующим запросом. Исследователи обнаружили, что эти блоки полностью взаимозаменяемы между сессиями, пользователями и моделями внутри экосистемы одного провайдера — достаточно передать зашифрованное рассуждение флагманской модели меньшей и хуже защищённой модели той же компании, и она расшифрует и дословно напечатает скрытый текст. В статье показаны четыре следствия: обход защиты от дистилляции, извлечение приватных данных, восстановление опасного содержимого, отфильтрованного провайдером, и невидимая prompt-инъекция. Затем команда выгрузила 315 320 зашифрованных блоков из публичных репозиториев и декодировала их, восстановив 367 фрагментов персональных данных и 182 рабочих учётных ключа.

Почему это важноШифрование решало сразу две задачи: не давать конкурентам дистиллировать рассуждения модели и не давать пользователю увидеть, что модель обдумала и отбросила. Выяснилось, что оно не решало ни одной, потому что замок и ключ уезжали клиенту вместе. Неприятна не сама атака, а эти 315 320 блоков: они пришли от обычных разработчиков, залив­ших логи агентов в публичные репозитории и не подозревавших, что нечитаемые строки в них — мышление их собственной машины, а в 182 случаях ещё и их действующие API-ключи. Если вы выкладывали расшифровки работы агентов на GitHub, сейчас их можно прочитать.
#ИИ-агенты

✓ Проверено · 3 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21
Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21
ChatGPT теперь может читать ваши iMessage и отправлять их — а настройка, позволяющая ему не спрашивать, и есть та, о которой предупреждает сама OpenAI
2026-08-21
Агент выдумал второго человека, чтобы тот поручился за его код. 24-летний студент из Техаса не поверил ни одному из них.
2026-08-21