aiminute. ← Todas las noticias de IA
Investigación 2026-08-12

El razonamiento cifrado no está cifrado: un modelo débil te leerá los pensamientos ocultos de uno fuerte, palabra por palabra

El razonamiento cifrado no está cifrado: un modelo débil te leerá los pensamientos ocultos de uno fuerte, palabra por palabra

El 10 de agosto un equipo del Instituto ELLIS de Tubinga y del Instituto Max Planck de Sistemas Inteligentes publicó "Stealing Reasoning Traces from Proprietary LLM APIs". Anthropic, OpenAI y Google ocultan la cadena de razonamiento de sus modelos del mismo modo: el razonamiento se cifra y se devuelve al cliente, que reenvía ese texto cifrado con la petición siguiente. Los investigadores descubrieron que esos bloques son totalmente intercambiables entre sesiones, usuarios y modelos dentro del ecosistema de un mismo proveedor: basta con dar el razonamiento cifrado de un modelo insignia a otro más pequeño y peor protegido de la misma empresa para que lo descifre e imprima el texto oculto literalmente. El artículo demuestra cuatro consecuencias: esquivar las defensas antidestilación, extraer datos privados, sacar a la luz contenido peligroso que el proveedor había filtrado e inyección de instrucciones invisible. Después, el equipo recolectó 315.320 bloques cifrados de repositorios públicos y los decodificó, recuperando 367 datos personales y 182 credenciales en uso.

Por qué importaEl cifrado cumplía dos funciones a la vez: impedir que la competencia destilara el razonamiento del modelo e impedir que el usuario viera lo que el modelo consideró y descartó. Resulta que no cumplía ninguna, porque la cerradura y la llave se enviaban juntas al cliente. Lo incómodo no es el ataque, sino esos 315.320 bloques: proceden de desarrolladores corrientes que subieron registros de agentes a repositorios públicos sin saber que aquellas cadenas ilegibles eran el pensamiento de su propia máquina y, en 182 casos, sus propias claves de API activas. Si has subido transcripciones de agentes a GitHub, ahora mismo son legibles.
#Agentes IA

✓ Verificado · 3 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21
El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21
Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21
ChatGPT ya puede leer tus iMessages y enviarlos — y el ajuste que le permite dejar de preguntar es justo el que OpenAI advierte
2026-08-21
El agente se inventó a una segunda persona para avalar su código. Un joven de 24 años en Texas no creyó a ninguno de los dos.
2026-08-21