Claude formaliza el Teorema de Fermat en Lean con 13 millones de líneas y 11 días de razonamiento autónomo

Claude generó 13 millones de líneas de código Lean en 11 días para formalizar el Teorema de Fermat, la prueba matemática más compleja jamás traducida a lenguaje verificable por computadora. El proyecto señala el camino hacia la IA autónoma en verificación formal de sistemas críticos.
Treinta años después de que Andrew Wiles pasara siete años probando el Teorema de Fermat en papel, el Claude de Anthropic tardó 11 días en transcribir esa misma prueba en Lean 4, un lenguaje de verificación formal que permite al computador confirmar mecánicamente cada paso del razonamiento. El resultado son 13 millones de líneas de código, el mayor archivo Lean jamás producido, según Anthropic. La formalización fue publicada la semana pasada con el código fuente completo del proyecto disponible para su uso.
Lo que Prove2Me hizo posible
El primer intento falló. Claude inició la formalización sin soporte adicional y no logró mantener coherencia lógica a lo largo de una tarea de duración tan alta. La solución fue incorporar Prove2Me, una herramienta de código abierto que ayuda a agentes de IA a determinar la próxima acción óptima en flujos de trabajo largos, cuando el contexto acumulado comienza a comprometer la calidad de las decisiones intermedias.
Con Prove2Me y un harness multiagente construido sobre Claude Code, el proyecto consumió aproximadamente 6 mil millones de tokens de salida a lo largo de casi dos semanas de ejecución. El modelo fue descrito por Anthropic como un modelo interno de investigación comparable a Claude Fable 5.1. La base de código acredita 106 archivos al proyecto FLT de Kevin Buzzard, matemático del Imperial College de Londres que había pasado años construyendo bloques matemáticos en Lean para una formalización manual que Anthropic concluyó en una fracción de ese tiempo. "Anthropic me venció", escribió Buzzard en el blog del Xena Project la semana pasada, reconociendo que la empresa había completado antes que él el objetivo que había perseguido durante años con colaboradores de todo el mundo.
Por qué esto es importante más allá de las matemáticas
El Teorema de Fermat es la prueba de estrés más extrema para verificación formal: no hay teorema más célebre ni razonamiento más largo para seguir paso a paso. La demostración de que Claude mantuvo coherencia lógica durante 11 días y 13 millones de líneas en Lean apunta a una aplicabilidad directa en otras tareas que exigen lógica sostenida y verificable: análisis de contratos financieros derivativos, conformidad regulatoria en Basilea IV, o verificación formal de código en sistemas bancarios, aeroespaciales y de dispositivos médicos.
La industria de verificación formal de software es pequeña y estratégica: valida los sistemas donde las fallas tienen consecuencias catastróficas. Empresas como Adacore, con sede en EE. UU. y Francia, y Galois, también estadounidense, construyen negocios enteros en torno a garantías formales de que los programas se comportan según lo especificado. Este segmento facturaba lo suficiente para contratar expertos a un alto costo por ser lento; la demostración de Anthropic comprime el tiempo de análisis de semanas a días.
Qué cambia por mercado
En el Reino Unido, el proyecto de Kevin Buzzard en el Imperial College había atraído colaboradores de decenas de universidades para construir bloques de prueba en Lean, una especie de esfuerzo de código abierto académico para formalización matemática. Este trabajo funcionó, en la práctica, como datos de entrenamiento para sistemas como Claude, sin que los investigadores hubieran negociado formalmente esta relación con Anthropic. La Royal Society y grupos de investigación británicos ya debaten qué significa esto para la financiación de matemáticas puras cuando un laboratorio estadounidense puede utilizar décadas de trabajo académico colaborativo en días de computación.
En Japón, la verificación formal es un componente obligatorio en certificar software para sistemas de control ferroviario e industrial; empresas como NTT Data y Hitachi Consulting cobran por hora a expertos para llevar a cabo esta validación. La demostración de Anthropic no elimina la demanda regulatoria de un humano responsable en el proceso, pero reduce drásticamente el componente técnico de la tarea, abriendo espacio para que competidores más pequeños ofrezcan el mismo servicio a menor costo utilizando Claude como palanca.
Qué se lleva el CIO de este logro
Anthropic publicó todo el código. Cualquier organización con capacidad de adaptar el harness puede probar el método en sus propios problemas de verificación formal. El logro no es solo sobre matemáticas: es sobre la demostración de que un agente de IA puede mantener razonamiento dirigido por objetivos durante días, descomponer un problema de máxima complejidad en subproblemas tratables y producir output verificable a lo largo de todo el proceso.
La próxima pregunta no es sobre teoremas. Es sobre qué sistema bancario o regulador de infraestructura crítica será el primero en sustituir parte de su proceso de validación formal por un agente basado en Claude, y qué ocurre con la cadena de responsabilidad cuando algo falla.