Fallo en Claude, GPT y Gemini permitió recuperar 315 mil bloques de razonamiento 'cifrado'

Un artículo de ocho investigadores decodificó el razonamiento interno de las APIs de OpenAI, Anthropic y Google, extrajo 182 credenciales válidas y 367 datos personales de sesiones públicas de desarrolladores.
Un artículo publicado en arXiv el 10 de agosto por ocho investigadores de las instituciones MATS Research, ELLIS Tübingen, Max Planck y el proveedor de seguridad Snyk nombró lo que los proveedores de LLM trataban como una caja negra: los reasoning tokens que intercambian entre llamadas de API en Claude, en GPT y en Gemini no eran opacos para el mundo, sino solo para el usuario final. OpenAI, Anthropic y Google cifraban estos bloques con una clave global compartida por todos los clientes, y cualquier cuenta de API estándar era suficiente para decodificarlos.
Los autores recorrieron 6.708 trayectorias de agentes ya publicadas en GitHub, Hugging Face y rastreadores de benchmarks. Decodificaron 315.320 bloques de razonamiento. Extrajeron 182 credenciales funcionales y 367 fragmentos distintos de información personal identificable. No se requería ningún privilegio elevado: el ataque opera con la misma clave que cualquier desarrollador utiliza para llamar a la API.
Lo que el diseño comprometió
La elección de una clave global vació el valor de seguridad del propio concepto de reasoning cifrado. En el artículo 'Stealing Reasoning Traces from Proprietary LLM APIs', los bloques son legibles para cualquier parte que tenga acceso a la clave compartida. En la práctica, esto incluye a cualquier cliente de pago y a cualquier investigador de cualquier laboratorio en el mundo.
Se documentaron cuatro caminos de abuso. El primero es la destilación: un proveedor competidor roba el patrón de razonamiento de un modelo de frontera para entrenar uno más barato. El segundo es la extracción de datos privados de trazas ya publicadas por otros desarrolladores. El tercero, más preocupante para los equipos de seguridad, es recuperar contenido peligroso que el modelo enmascaró en la respuesta visible pero mantuvo en la cadena de razonamiento. El cuarto es incrustar inyecciones de prompt dentro del bloque opaco, invisibles para el desarrollador que revisa el registro de la conversación después.
Los proveedores mitigaron, el agujero arquitectónico permanece
OpenAI, Anthropic y Google recibieron la divulgación coordinada y el ataque principal no es reproducible desde agosto de 2026, según la declaración de reproducibilidad de los autores. Microsoft y Hugging Face también fueron notificados.
Lo que no se resuelve con una rotación de clave es el incentivo del modelo comercial. Al vender el razonamiento como un token facturado sin devolver el texto al cliente, los proveedores crearon una superficie opaca que el propio comprador no puede auditar. Si una traza de razonamiento contiene una contraseña, un dato clínico o una cláusula contractual, el dueño de ese dato es el cliente, pero no ve ni controla lo que allí circula. La opacidad es contractual, no criptográfica.
Lo que cambia para quienes ya han implementado agentes en producción
Bancos que operan agentes Claude Code en flujos internos, como JPMorgan Chase, con 200 mil empleados en el LLM Suite y alrededor de 400 casos de uso de IA en producción, y UBS, necesitan responder a una pregunta operativa: si un agente procesó un contrato o una pantalla de token de sesión, ese contenido pudo haber viajado por un bloque de razonamiento compartido. La auditoría de lo que pasó por los registros recae en el cliente, no en el proveedor. Y como el diseño ya era así cuando los primeros agentes Claude y GPT-5 se implementaron en producción en 2025 y en el primer semestre de 2026, la ventana de exposición no es hipotética, es retrospectiva.
En Europa, el problema toca el Artículo 32 del GDPR, que exige medidas técnicas adecuadas para datos personales. Las trazas de razonamiento que contienen PII cifradas con clave global difícilmente cumplen con esta prueba. La AI Office, que ganó poder para aplicar multas el 2 de agosto bajo la Ley de IA, tiene un interés directo en el caso: los proveedores de GPAI son responsables de la transparencia sobre el riesgo sistémico, y una falla de tal magnitud cabe en el perímetro de la aplicación.
En India, donde los centros de entrega de TCS, Infosys y Cognizant escriben buena parte del código agente que actualmente opera en producción en EE. UU. y el Reino Unido, la exposición es doble. Estos centros publican trayectorias de prueba en repositorios abiertos para colaboración. Parte de los 6.708 trazas que los investigadores decodificaron provino exactamente de este tipo de repositorio.
Para los equipos de seguridad, el consumible práctico de la divulgación es revisar lo que ya se ha publicado. Buscar trayectorias de agentes propias en repositorios abiertos. Rotar todas las credenciales que puedan haber pasado por razonamiento interno en los últimos meses. Y revisar contratos de suministro: lo que es opacidad útil y lo que es opacidad cómoda para el vendedor ha dejado de ser una pregunta filosófica.