Investigación
2026-08-12
El razonamiento cifrado no está cifrado: un modelo débil te leerá los pensamientos ocultos de uno fuerte, palabra por palabra
El 10 de agosto un equipo del Instituto ELLIS de Tubinga y del Instituto Max Planck de Sistemas Inteligentes publicó "Stealing Reasoning Traces from Proprietary LLM APIs". Anthropic, OpenAI y Google ocultan la cadena de razonamiento de sus modelos del mismo modo: el razonamiento se cifra y se devuelve al cliente, que reenvía ese texto cifrado con la petición siguiente. Los investigadores descubrieron que esos bloques son totalmente intercambiables entre sesiones, usuarios y modelos dentro del ecosistema de un mismo proveedor: basta con dar el razonamiento cifrado de un modelo insignia a otro más pequeño y peor protegido de la misma empresa para que lo descifre e imprima el texto oculto literalmente. El artículo demuestra cuatro consecuencias: esquivar las defensas antidestilación, extraer datos privados, sacar a la luz contenido peligroso que el proveedor había filtrado e inyección de instrucciones invisible. Después, el equipo recolectó 315.320 bloques cifrados de repositorios públicos y los decodificó, recuperando 367 datos personales y 182 credenciales en uso.
Por qué importaEl cifrado cumplía dos funciones a la vez: impedir que la competencia destilara el razonamiento del modelo e impedir que el usuario viera lo que el modelo consideró y descartó. Resulta que no cumplía ninguna, porque la cerradura y la llave se enviaban juntas al cliente. Lo incómodo no es el ataque, sino esos 315.320 bloques: proceden de desarrolladores corrientes que subieron registros de agentes a repositorios públicos sin saber que aquellas cadenas ilegibles eran el pensamiento de su propia máquina y, en 182 casos, sus propias claves de API activas. Si has subido transcripciones de agentes a GitHub, ahora mismo son legibles.
✓ Verificado · 3 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21ChatGPT ya puede leer tus iMessages y enviarlos — y el ajuste que le permite dejar de preguntar es justo el que OpenAI advierte
2026-08-21El agente se inventó a una segunda persona para avalar su código. Un joven de 24 años en Texas no creyó a ninguno de los dos.
2026-08-21