Investigación
2026-08-17
Dos de los matemáticos más laureados del mundo miraron qué resuelve realmente la IA y llegaron a la misma pieza que falta
Timothy Gowers, medalla Fields, publicó el 12 de agosto un texto en el que intenta separar las matemáticas en las que los modelos de lenguaje se manejan bien y aquellas en las que no. Su conclusión es que los modelos son fuertes donde se puede llegar a un resultado ensamblando técnicas conocidas —la búsqueda de contraejemplos aparece de forma llamativa en su lista de aciertos— y débiles en el juicio sobre qué dirección merece intentarse cuando el espacio de búsqueda es enorme. Aclara que todavía no existe una clasificación limpia y pide a los teóricos ayuda para formalizarla. Peter Sarnak, escribiendo en julio en las Notices de la American Mathematical Society, llegó a un lugar parecido desde otro ángulo: la IA puede derivar consecuencias de teoría ya existente, pero le cuesta inventar las abstracciones nuevas sobre las que suelen construirse las grandes demostraciones. Un artículo de Tom Zahavy, de DeepMind, titulado 'LLMs Can't Jump', nombra el mismo cuello de botella en términos técnicos: la incapacidad de postular nuevos supuestos fundamentales. Ninguno de estos es un experimento controlado; son valoraciones expertas de cómo se comportan las herramientas en trabajo matemático real.
Por qué importaEs una señal más útil que otra puntuación de benchmark, porque los benchmarks miden sobre todo aquello en lo que, según estos matemáticos, los modelos ya son buenos: cerrar un hueco cuando el objetivo está enunciado y las herramientas son conocidas. La parte que señalan como ausente —decidir qué merece intentarse e inventar el concepto que vuelve tratable un problema— es justamente lo que no aparece como pregunta con solucionario y, por tanto, tampoco en las evaluaciones. Es además una advertencia contra leer los resultados de olimpiadas y competiciones como prueba de capacidad de investigación, ya que los problemas de competición son, por construcción, resolubles con métodos conocidos.
✓ Verificado · 3 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21El agente se inventó a una segunda persona para avalar su código. Un joven de 24 años en Texas no creyó a ninguno de los dos.
2026-08-21Pew pasó medio millón de páginas web por un detector: un tercio de todo lo publicado desde ChatGPT lleva sus marcas
2026-08-21La FDA ha autorizado 1.357 dispositivos médicos con IA. Tres se han evaluado según si los pacientes viven más o mejor.
2026-08-20