1.221 voluntarios dirigieron agentes de IA a 2.200 trabajos científicos. Casi una cuarta parte no resistió
Hugging Face publicó cada intento de un reto de 19 días para repetir experimentos de ICML 2026 con agentes de programación. En 496 trabajos se cuestionó o refutó al menos una afirmación.
Hugging Face ha publicado los resultados de un experimento inusual para comprobar la ciencia. Entre el 15 de julio y el 2 de agosto, 1.221 voluntarios utilizaron agentes de programación con IA para intentar repetir los experimentos de trabajos aceptados en ICML 2026, una de las mayores conferencias de aprendizaje automático. Revisaron más de 2.200 de los 6.341 trabajos y produjeron 6.816 cuadernos públicos. Todos los intentos están en línea, incluidos los fallidos.
La cifra principal es que 496 trabajos, cerca del 23 % de los examinados, tenían al menos una afirmación central cuestionada o refutada. Cuarenta y nueve perdieron todas sus afirmaciones: no se pudo verificar nada. Y en 242, equipos distintos emitieron veredictos opuestos sobre la misma afirmación, un hallazgo en sí mismo.
Los participantes eligieron herramientas y hardware. Claude Code, Codex, Cursor y orx de OpenResearch aparecen en los registros. Primero se indexaron las afirmaciones centrales de cada trabajo; después se dejó a un agente reproducirlas y se publicaron los métodos, resultados y a menudo la traza completa de ejecución en Hugging Face.
La importancia va más allá de puntuar artículos concretos. ICML aceptó 6.341 trabajos este año, aproximadamente el doble que el anterior. Ningún comité voluntario puede leer tanto con atención, mucho menos volver a ejecutar el código. La reproducción siempre ha sido la parte de la ciencia que todos consideran esencial y para la que nadie tiene tiempo. Los agentes de programación son pacientes, baratos e incansables justo como requiere este trabajo; es uno de los argumentos más convincentes hasta ahora de que sirven para algo más que lanzar funciones. Una salvedad justa, que señalan los organizadores: que un agente no reproduzca un resultado no demuestra que sea falso. Datos ausentes, ajustes sin documentar y diferencias de hardware provocan fallos que no dicen nada sobre la ciencia. Por eso los 242 trabajos con veredictos contradictorios son los más interesantes del conjunto.
Qué significa para ti: al leer titulares sobre IA, recuerda esta proporción. «Un nuevo estudio demuestra» es una frase mucho más débil de lo que parece, incluso en una conferencia de primer nivel, antes de preguntar si el benchmark mide algo real. Si trabajas en investigación o ingeniería y dependes de resultados publicados, los cuadernos se pueden buscar para comprobar si el trabajo que usarás fue reproducido. Y si buscas un ejemplo concreto y sin exageraciones de aquello en lo que los agentes son realmente buenos, este supera muchas demostraciones: 6.816 verificaciones tediosas que de otro modo nunca se habrían hecho.
Fuentes
Fuentes: https://huggingface.co/blog/icml-2026-open-reproductions
La publicidad llega a ChatGPT en Europa este mes
OpenAI ha avisado a los usuarios Free y Go del EEE y Suiza de que los anuncios aparecerán más adelante en agosto. Los planes de pago siguen limpios y personalizarlos requiere tu consentimiento explícito.