<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Prove2Me | guIA</title><link>https://guia.desdeelsur.org/tags/prove2me/</link><atom:link href="https://guia.desdeelsur.org/tags/prove2me/index.xml" rel="self" type="application/rss+xml"/><description>Prove2Me</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>es-ar</language><lastBuildDate>Sat, 05 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://guia.desdeelsur.org/media/sharing.png</url><title>Prove2Me</title><link>https://guia.desdeelsur.org/tags/prove2me/</link></image><item><title>Trece millones de líneas en el margen: qué hace que éste sea el buen caso</title><link>https://guia.desdeelsur.org/blog/2026-09-05-trece-millones-de-lineas-en-el-margen/</link><pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate><guid>https://guia.desdeelsur.org/blog/2026-09-05-trece-millones-de-lineas-en-el-margen/</guid><description>&lt;p&gt;&lt;strong&gt;Sobre:&lt;/strong&gt; &amp;ldquo;Formalizing Fermat&amp;rsquo;s Last Theorem&amp;rdquo; — Anthropic, 4 de septiembre de 2026.
·
&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;Once días, más de trece millones cuatrocientas mil líneas de Lean, veintinueve mil quinientos teoremas intermedios y unos seis mil millones de tokens de salida. Con eso, varias decenas de agentes de Claude produjeron la primera demostración del último teorema de Fermat verificada íntegramente por computadora, y cerraron de paso la lista de cien teoremas que Freek Wiedijk mantenía abierta desde hace veinte años. El matemático que dirige el proyecto de formalizar ese mismo teorema revisó el resultado y escribió que, matemáticamente, esto no nos dice esencialmente nada. Tiene razón, y es exactamente por eso que vale la pena mirarlo.&lt;/p&gt;
&lt;h2 id="lo-que-hay-adentro-del-artefacto"&gt;Lo que hay adentro del artefacto&lt;/h2&gt;
&lt;p&gt;La versión que circula —la máquina resolvió en once días lo que a Wiles le llevó siete años— es falsa en las dos mitades, y la propia Anthropic no la sostiene. Andrew Wiles demostró el teorema en 1995, en ciento veintinueve páginas que llevaron meses de revisión y a las que hubo que remendarles un año después un agujero encontrado durante ese proceso. Lo que hicieron los agentes no fue encontrar una demostración sino transcribir una: siguieron la exposición simplificada de Darmon, Diamond y Taylor y la volcaron a un lenguaje cuyo compilador no acepta nada por confianza. Los once días son tiempo de reloj de decenas de agentes en paralelo, coordinados a través de Prove2Me —una plataforma abierta del grupo de Tianyi Peng en Columbia que mantiene el grafo de dependencias entre teoremas y le dice a cada agente qué falta—, con una intervención humana que se limitó a instrucciones ocasionales de altísimo nivel, del orden de &lt;em&gt;el jacobiano como esquema suena prioritario&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;El resultado, además, es más angosto de lo que el titular sugiere: la formalización cubre los exponentes primos mayores o iguales a diecisiete, y el resto ya estaba hecho por humanos.&lt;sup id="fnref:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt; Buzzard, que había declarado antes de todo esto que estaba 99,9% seguro de que la demostración de Fermat era correcta, no cambió esa cifra al leer el repositorio. No hay conocimiento matemático nuevo acá. Hay un artefacto de ingeniería de una escala que no existía hace un mes, y el conocimiento que produce no es sobre Fermat sino sobre lo que estos sistemas pueden hacer cuando alguien les pone del otro lado algo que les diga que no.&lt;/p&gt;
&lt;h2 id="el-núcleo-no-pregunta-quién-escribió"&gt;El núcleo no pregunta quién escribió&lt;/h2&gt;
&lt;p&gt;Anthropic escribe, en una frase que en su prosa institucional es casi una confesión, que la formalización es un lugar donde se sienten inequívocamente bien respecto del papel de la IA. Vale reconstruir por qué antes de discutirlo, porque la razón es buena y no tiene nada que ver con las virtudes del modelo. Lean verifica cada paso contra un núcleo diminuto que sólo admite tres axiomas, y ese núcleo es indiferente a la procedencia de lo que revisa: no sabe si las líneas las escribió un doctorando, un swarm de agentes o un generador aleatorio con mucha suerte, y su veredicto cuesta unas horas de cómputo mientras que producir lo que revisa costó seis mil millones de tokens.&lt;sup id="fnref:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt; Un productor no confiable acoplado a un verificador barato, independiente y hostil da un sistema confiable. Ésa es toda la magia, y es una propiedad del dominio, no del modelo.&lt;/p&gt;
&lt;p&gt;Lo que sobrevive de la objeción habitual —que nadie leyó las trece millones de líneas y por lo tanto nadie sabe qué dicen— es más chico y más preciso de lo que parece. El núcleo certifica que las líneas implican el enunciado a partir de los axiomas; no certifica que el enunciado sea el que uno quería demostrar. Por eso el equipo corrió una herramienta comparadora contra la formulación que Mathlib tiene del teorema, y por eso Buzzard fue a mirar el enunciado. Ese paso, que es el más corto de todo el proceso, es el único irreduciblemente humano, y no hay cantidad de tokens que lo acorte: alguien tiene que responder si lo que quedó escrito arriba de las trece millones de líneas dice lo que el mundo entiende por &lt;em&gt;no existen enteros positivos que satisfagan la ecuación&lt;/em&gt;. Toda la confiabilidad del artefacto se apoya en una lectura de tres renglones.&lt;/p&gt;
&lt;h2 id="un-regalo-que-el-común-no-puede-levantar"&gt;Un regalo que el común no puede levantar&lt;/h2&gt;
&lt;p&gt;Nada de esto pasa sin Mathlib. La biblioteca comunitaria sobre la que se apoya la demostración la escribieron durante años cientos de matemáticos, en buena medida sin que nadie les pagara por eso; el repositorio de Anthropic acredita ciento seis archivos tomados del proyecto FLT de Buzzard en el Imperial College —financiado por el EPSRC británico con un millón de libras a cinco años— y del proyecto flt-regular. La demostración resultante es más de cinco veces el tamaño de Mathlib y tarda casi veinte veces más en compilar, en una máquina de noventa y seis núcleos. Está en GitHub, con licencia abierta, y probablemente ahí se quede.&lt;/p&gt;
&lt;p&gt;Ésa es la parte que conviene mirar despacio, porque no es un cercamiento y decirlo así sería más cómodo que exacto. No se llevaron nada: Mathlib sigue entera, el código está publicado, y en un año en que las liberaciones de modelos consistieron en elegir cuál capa se abre y cuál se cobra, un repositorio completo y auditable es más de lo que suele haber. El problema es de otro orden. Mathlib es un común porque se puede mantener: alguien lee un archivo, entiende qué hace, lo generaliza, lo refactoriza, discute el nombre de un lema en Zulip. Trece millones cuatrocientas mil líneas escritas para pasar el compilador no admiten ese trato, y Buzzard supone —con buenas razones— que Anthropic no va a hacer el trabajo de convertirlas en algo que la comunidad pueda absorber. Sus dos objetivos declarados, meter en Mathlib los objetos fundamentales de la teoría de números moderna y armar un documento dinámico que le permita a un humano recorrer la demostración, siguen siendo suyos y siguen pendientes. Un común no se mide por lo que se puede descargar sino por lo que alguien puede sostener; con ese criterio, lo que volvió al común no es la demostración sino la noticia de que la demostración es posible.&lt;/p&gt;
&lt;h2 id="tres-suscripciones"&gt;Tres suscripciones&lt;/h2&gt;
&lt;p&gt;Hay un segundo experimento en el anuncio que a un lector de la región le importa más que los trece millones de líneas: un grupo de agentes corriendo sobre tres suscripciones personales de Claude Max, coordinados por la misma plataforma, formalizó en tres días el teorema de los tres primos de Vinogradov. Eso no es una demostración de fuerza; es un cambio en el precio de entrada, y hay que concederlo entero. La formalización era, hasta esta semana, la única rama de la matemática contemporánea cuya barrera era el tiempo y no el capital: Lean corre en una notebook, Mathlib es gratis, y la comunidad acepta contribuciones de cualquiera cuyo código compile. Para departamentos que no van a comprar un clúster de GPUs en esta década, era la puerta abierta, y sigue abierta, y ahora se cruza más rápido.&lt;/p&gt;
&lt;p&gt;La objeción no es sobre el acceso a la herramienta sino sobre la unidad de medida. Si lo que era una tesis doctoral de formalización pasa a ser tres días de agentes, entonces lo que cuenta como &lt;em&gt;un proyecto&lt;/em&gt; en el campo lo fija quien puede pagar el enjambre más grande, y la distancia entre tres suscripciones y varias decenas de agentes sobre un modelo interno no es de precio sino de disponibilidad: el modelo que hizo Fermat no está a la venta.&lt;sup id="fnref:3"&gt;&lt;a href="#fn:3" class="footnote-ref" role="doc-noteref"&gt;3&lt;/a&gt;&lt;/sup&gt; Conviene además nombrar lo que acá no hay, porque el vocabulario crítico se gasta cuando se usa por reflejo: no hubo extracción de datos del Sur, ni trabajo fantasma de anotación, ni un corpus local convertido en insumo. La asimetría es de otro tipo, más simple y más difícil de revertir, y consiste en que la capacidad que produjo el resultado no se puede alojar acá ni comprar afuera.&lt;/p&gt;
&lt;h2 id="qué-otra-cosa-tiene-núcleo"&gt;Qué otra cosa tiene núcleo&lt;/h2&gt;
&lt;p&gt;La lección transferible de estos once días no es que la máquina hace matemática. Es un criterio, y es más exigente de lo que parece: la IA funciona sin supervisión donde existe un verificador que sea barato en relación con la producción, independiente de quien produce y público. Es útil recorrer con ese criterio en la mano los despliegues que efectivamente se están discutiendo en la región. Un sistema de asignación de prestaciones sociales no tiene verificador barato: comprobar que una baja fue correcta cuesta más que producirla, y el afectado se entera cuando no le llega la transferencia. Un corrector automático de exámenes no tiene verificador independiente: lo audita el mismo que lo compró. Un triage médico no tiene verificador público: la verdad llega meses después, dispersa en historias clínicas que nadie cruza. En los tres casos se está desplegando igual, y la diferencia con Fermat no es de riesgo ni de ambición sino de infraestructura epistémica.&lt;/p&gt;
&lt;p&gt;Lean y Mathlib llevan más de una década construyéndose, buena parte con trabajo voluntario y financiamiento público, y sin ese núcleo el resultado de esta semana no sería un resultado sino un archivo de trece millones de líneas que nadie tendría motivo para creer. La pregunta que deja abierta no es si la máquina demuestra teoremas. Es cuánto tarda en construirse un núcleo, con qué plata y a cargo de quién, cuando lo que hay que verificar no son teoremas sino expedientes.&lt;/p&gt;
&lt;div class="footnotes" role="doc-endnotes"&gt;
&lt;hr&gt;
&lt;ol&gt;
&lt;li id="fn:1"&gt;
&lt;p&gt;La demostración formalizada por Claude vale para exponentes primos p ≥ 17, que es hasta donde llega la ruta vía teoría de Fontaine y el trabajo de Mazur sobre el ideal de Eisenstein. Los exponentes chicos ya estaban cubiertos: Best, Birkbeck, Brasca, Rodriguez, van der Velde y Yang habían formalizado el caso de los primos regulares impares, y el menor primo irregular es 37, de modo que 3, 5, 7, 11 y 13 entran por ahí. La unión de las dos piezas cierra el teorema, lo que quiere decir que el resultado completo es, también en esto, un objeto colectivo.&amp;#160;&lt;a href="#fnref:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:2"&gt;
&lt;p&gt;El núcleo de Lean es la pieza de software cuya corrección hay que suponer para creerle a todo lo demás, y es deliberadamente diminuto; los tres axiomas son extensionalidad proposicional, elección clásica y solidez del cociente. La estrategia —un verificador chico y auditable que revise pruebas producidas por cualquier cosa, incluso por heurísticas sin garantías— se conoce como criterio de de Bruijn y tiene medio siglo. Que sea exactamente la arquitectura que hoy vuelve tolerable un productor probabilístico es una coincidencia histórica que merece más atención de la que recibió esta semana.&amp;#160;&lt;a href="#fnref:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:3"&gt;
&lt;p&gt;Un orden de magnitud, con todas las advertencias: seis mil millones de tokens de salida, a la tarifa pública de un modelo comparable al que se usó (cincuenta dólares por millón), dan unos trescientos mil dólares. La corrida real se hizo con un modelo interno y no se facturó a esa tarifa, así que la cifra no es el costo sino el precio que tendría comprarla, y sirve sólo para la comparación que importa: es cerca de un tercio del subsidio de cinco años con el que se financia el proyecto humano equivalente, gastado en once días.&amp;#160;&lt;a href="#fnref:3" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/div&gt;</description></item></channel></rss>