aiminute. ← Todas las noticias de IA
Investigación AI Minute Newsroom 2026-08-12

El razonamiento cifrado no está cifrado: un modelo débil te leerá los pensamientos ocultos de uno fuerte, palabra por palabra

El razonamiento cifrado no está cifrado: un modelo débil te leerá los pensamientos ocultos de uno fuerte, palabra por palabra

El 10 de agosto un equipo del Instituto ELLIS de Tubinga y del Instituto Max Planck de Sistemas Inteligentes publicó "Stealing Reasoning Traces from Proprietary LLM APIs". Anthropic, OpenAI y Google ocultan la cadena de razonamiento de sus modelos del mismo modo: el razonamiento se cifra y se devuelve al cliente, que reenvía ese texto cifrado con la petición siguiente. Los investigadores descubrieron que esos bloques son totalmente intercambiables entre sesiones, usuarios y modelos dentro del ecosistema de un mismo proveedor: basta con dar el razonamiento cifrado de un modelo insignia a otro más pequeño y peor protegido de la misma empresa para que lo descifre e imprima el texto oculto literalmente. El artículo demuestra cuatro consecuencias: esquivar las defensas antidestilación, extraer datos privados, sacar a la luz contenido peligroso que el proveedor había filtrado e inyección de instrucciones invisible. Después, el equipo recolectó 315.320 bloques cifrados de repositorios públicos y los decodificó, recuperando 367 datos personales y 182 credenciales en uso.

Por qué importaEl cifrado cumplía dos funciones a la vez: impedir que la competencia destilara el razonamiento del modelo e impedir que el usuario viera lo que el modelo consideró y descartó. Resulta que no cumplía ninguna, porque la cerradura y la llave se enviaban juntas al cliente. Lo incómodo no es el ataque, sino esos 315.320 bloques: proceden de desarrolladores corrientes que subieron registros de agentes a repositorios públicos sin saber que aquellas cadenas ilegibles eran el pensamiento de su propia máquina y, en 182 casos, sus propias claves de API activas. Si has subido transcripciones de agentes a GitHub, ahora mismo son legibles.
#Agentes IA

✓ Verificado · 3 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Un modelo aprendió sin el método que entrena a toda la IA.
2026-10-06
TikTok metió un chatbot de compras dentro del vídeo que ves.
2026-10-06
Wikimedia sospecha de agentes de OpenAI por la caída de mayo.
2026-10-06
El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05
Dos senadores piden cárcel para jefes cuyos agentes de IA hackean.
2026-10-05