Un repositorio de 722 manuscritos, no 722 certezas cerradas
OpenAI abrió el martes 6 de octubre un repositorio público con 722 manuscritos matemáticos producidos por un modelo interno de inteligencia artificial. La empresa los organiza en 372 familias: una familia puede reunir un resultado principal, argumentos complementarios, consecuencias o pruebas alternativas. Por eso, ni el número de archivos equivale al número de problemas resueltos ni cada documento tiene el mismo alcance.
La publicación llegó acompañada de una nota de investigación, materiales de apoyo y un sistema para conservar versiones y correcciones. OpenAI presenta el conjunto como resultados sobre problemas abiertos, pero el propio repositorio deja una cautela explícita: los trabajos se encuentran en distintos estados de verificación, no todos incorporan una formalización en Lean y algunos de los resultados no formalizados pueden contener fallos.
El modelo sigue sin estar disponible
La mayoría de los resultados se obtuvo con un modelo interno que OpenAI aún no ha puesto a disposición del público. Según la documentación del repositorio, el sistema recibió aproximadamente 4.000 problemas y cada resultado seleccionado consumió, de media, un cálculo equivalente a unas tres horas de razonamiento de ChatGPT Pro. La compañía no publica en esta entrega una vía para que investigadores externos repitan todo el proceso con el mismo modelo.
Sí ha liberado los manuscritos, archivos de prueba y diez resúmenes abreviados del razonamiento del modelo. Esa apertura permite inspeccionar el resultado final y corregirlo, pero no convierte el experimento completo en reproducible. La distinción importa: revisar una demostración publicada no es lo mismo que poder repetir cómo se eligió el problema, qué indicaciones recibió el modelo y qué intentos se descartaron.
Qué demuestra Lean y qué sigue necesitando personas
Lean es un asistente de demostración capaz de comprobar de forma mecánica que una cadena formal de pasos alcanza una proposición concreta dentro de unas reglas definidas. OpenAI incluye formalizaciones para muchos de los manuscritos y prevé añadir más. Es una evidencia fuerte sobre la corrección lógica de la parte formalizada, siempre que el enunciado verificado corresponda exactamente con la afirmación que se comunica.
La comprobación automática no resuelve por sí sola otras preguntas científicas: si el resultado es realmente nuevo, si las hipótesis recogen el problema anunciado, si la exposición permite entender la idea, si existen trabajos previos equivalentes o si una consecuencia presentada fuera del núcleo formalizado es correcta. Tampoco valida en bloque los documentos que todavía solo están escritos como manuscritos convencionales.
La escala de la publicación abre un conflicto sobre quién revisa
La reacción no ha sido uniforme. Medios como Axios destacan la posibilidad de que la inteligencia artificial acelere el trabajo en áreas científicas que antes parecían fuera de su alcance. Al mismo tiempo, TechCrunch recoge dudas de matemáticos sobre si la forma de publicar cumple las normas habituales de discusión, atribución y revisión de la disciplina.
La Association for Human Mathematics, una organización crítica con el uso de problemas abiertos como banco de pruebas para modelos privados, pidió a los matemáticos que dejaran de colaborar con OpenAI. Su objeción no certifica que los resultados sean falsos; cuestiona el modelo de investigación y el traslado de la carga de revisar cientos de documentos a una comunidad que no eligió el experimento. Conviene separar ambas discusiones: corrección matemática y condiciones de producción no son la misma pregunta.
Por qué los titulares no coinciden en la cifra
La cobertura ha alternado referencias a 372, 377 y 722 resultados. El dato estable del repositorio es más preciso: 722 manuscritos agrupados en 372 familias. Algunas informaciones cuentan familias de resultados, otras documentos y otras incorporan avances presentados en anuncios anteriores. Hablar de 722 teoremas demostrados borra esa diferencia y exagera el grado de validación disponible.
También es prematuro presentar las 372 familias como una lista cerrada de descubrimientos aceptados. La propia empresa promete registrar revisiones y mantener accesibles las versiones anteriores. Ese diseño admite que el catálogo puede cambiar a medida que especialistas revisen argumentos, comparen literatura previa y encuentren errores o formulaciones más limitadas de lo que sugieren los resúmenes.
Qué cambia para lectores e investigadores en España
No hay una nueva función de ChatGPT que un estudiante o un centro de investigación español pueda activar hoy para reproducir estos resultados. La novedad es una señal de capacidad de un sistema no publicado y un gran corpus que ya puede ser auditado. Para universidades y grupos de investigación, el trabajo inmediato está en seleccionar resultados de su especialidad, comprobar el enunciado exacto y contrastar la bibliografía antes de citar una conclusión como establecida.
Para el público general, la lección es más sencilla: una prueba generada por IA puede estar formalmente comprobada en una parte y seguir necesitando revisión humana sobre su novedad, alcance y significado. El volumen no sustituye esa revisión. Hasta que cada familia relevante reciba escrutinio independiente, la publicación debe leerse como una colección extraordinaria de afirmaciones y artefactos de prueba, no como el cierre simultáneo de cientos de preguntas matemáticas.
Lo siguiente será medir correcciones, no solo anuncios
Las próximas semanas deberían aclarar cuántos resultados sobreviven sin cambios, cuáles necesitan una corrección y cuáles aportan una idea nueva reconocida por especialistas externos. También será relevante si OpenAI publica más detalles del proceso y si el repositorio migra a una infraestructura gobernada por la comunidad, una posibilidad que la empresa dice estar explorando.
El indicador útil ya no será cuántos manuscritos caben en una subida, sino cuántos pueden entenderse, reproducirse, atribuirse correctamente y convertirse en conocimiento compartido. Ahí empieza la prueba verdaderamente difícil de esta publicación.