Uso de Claude para mísseis no Iémen e furto de 151 milhões

Un grupo en el norte de Yemen usó Claude para sistemas de misil; operadores vinculados a Alibaba extrajeron 151 millones de conversaciones. El informe abarca operaciones de diciembre de 2025 a agosto de 2026.
Según un informe de inteligencia de amenazas publicado por Anthropic el 12 de septiembre, un grupo en el norte de Yemen utilizó Claude Code donde normalmente estarían ingenieros especializados, produciendo código de guiaggio, navegación y control para tres programas de misiles. Uno de los proyectos documentados prevé un alcance superior a 2,000 kilómetros. El informe cubre operaciones detectadas entre diciembre de 2025 y agosto de 2026 y presenta la conclusión más explícita del campo hasta la fecha: la IA ya no es una herramienta de apoyo en operaciones maliciosas. Es el ejecutor autónomo de la cadena operacional.
Estados y agentes autónomos: de Rusia a Yemen
El agrupamiento ruso GTG-20006 aparece en el informe como caso central de espionaje asistido por IA. Según Anthropic, el grupo desarrolló flujos de trabajo que automatizaron operaciones contra objetos ucranianos, europeos y diplomáticos, desde la adquisición de infraestructura y phishing hasta persistencia en red, comando y control y exfiltración de datos. En la mayoría de las operaciones documentadas, estructuras multiagente completaron el ciclo completo de reconocimiento, explotación y recolección de credenciales con supervisión humana mínima. Los operadores seleccionaban objetivos y revisaban resultados; el modelo ejecutaba.
El caso de Yemen sigue una lógica diferente. En lugar de usar IA para escalar o automatizar ataques cibernéticos, el grupo empleó Claude Code como un sustituto de ingeniería militar especializada, generando código funcional de GNC (guiaggio, navegación y control) para sistemas de misiles. El programa con un alcance superior a 2,000 kilómetros es categóricamente distinto de los cohetes tácticos documentados en conflictos regionales anteriores. Anthropic afirma haber detectado e interrumpido la operación antes de cualquier uso del código en prueba o producción.
Destilación industrial: 151 millones de conversaciones y siete laboratorios
El caso más voluminoso del informe involucra operadores vinculados a Alibaba que recolectaron 151 millones de conversaciones de Claude con el objetivo de transferir capacidades a modelos Qwen. Es el mayor episodio documentado de extracción ilícita de propiedad intelectual de modelo hasta la fecha, y cuestiona la tesis de que el alineamiento y capacidades de modelos frontier están adecuadamente protegidos por los términos de uso.
El informe menciona otras seis organizaciones chinas, entre ellas Moonshot, DeepSeek, Z.ai y MiniMax, que utilizaron 'estaciones de transferencia' fuera de China para redirigir consultas a Claude y eludir restricciones geográficas de acceso. Alibaba, Moonshot y DeepSeek no habían comentado sobre los hallazgos del informe hasta el cierre de este artículo. Anthropic afirma haber interrumpido todas las siete operaciones.
La implicación para empresas que licencian modelos frontier va más allá de los casos documentados. La extracción a escala industrial depende del volumen de acceso. Cualquier organización con claves de API distribuidas a un gran número de usuarios o sistemas automatizados amplía la superficie de extracción. Las 151 millones de conversaciones fueron recolectadas con acceso que pasó por verificaciones de uso en tiempo real, lo que hace que el control basado en rate limiting sea insuficiente por sí solo.
Qué cambia para CISOs y arquitectos de IA
Para los equipos de seguridad, el informe reformula el problema de detección. Operaciones conducidas por agentes autónomos tienen una cadencia diferente a las operaciones humanas: ejecutan pasos sucesivos sin pausa para análisis, acceden a sistemas sin respetar horarios comerciales y generan patrones de comportamiento que herramientas calibradas para operadores humanos pueden no reconocer como anómalos. Una revisión de modelos de detección que asumen comportamiento humano en la cima de la cadena de ataque ha pasado a ser una necesidad documentada, no especulación.
Para empresas europeas, el mapeo de las operaciones del GTG-20006 contra objetivos en el continente es una relevancia inmediata. Organizaciones en sectores de alto interés estratégico, fabricantes de defensa, operadores de infraestructura crítica y consultorías que atienden gobiernos, necesitan recalibrar hipótesis de amenaza para incluir adversarios con cadencia de ejecución automatizada y operación ininterrumpida.
En el plano legislativo americano, los senadores Amy Klobuchar y John Thune avanzan con una propuesta de supervisión en respuesta al informe, según el Washington Post. El texto aún no tiene versión final, pero los casos documentados por Anthropic, en especial el uso de Claude Code en programas de misiles, funcionarán como material central en audiencias en el Congreso.
La pregunta que el documento deja abierta: si los modelos de uso general ya reemplazan a ingenieros militares especializados en código de guiaggio balístico, ¿los frameworks de evaluación de riesgo que asumen capacidad técnica humana en la cima de la cadena de amenaza siguen siendo la medida adecuada?