METR propone otra forma de preguntar si un agente de IA es realmente más barato que una persona
El laboratorio propone el horizonte de gasto: el presupuesto a partir del cual una persona resulta más rentable que un agente en la misma optimización. En una primera prueba, el cruce estaba entre cero y 3.000 dólares.
La mayoría de benchmarks responde sí o no: ¿resolvió el modelo la tarea? METR, laboratorio sin ánimo de lucro que evalúa modelos de frontera para los grandes laboratorios, propone una métrica para una pregunta más útil: ¿con qué presupuesto se convierte una persona en la mejor compra? La llama horizonte de gasto y la define como la cantidad a la que la mejora de un agente iguala la que aportaría una persona por el mismo dinero.
El caso es NanoGPT speedrun, una competición comunitaria para entrenar un pequeño modelo lo más rápido posible. Es adecuado porque las personas ya lo han optimizado mucho. METR midió primero el coste del progreso humano: cada punto porcentual adicional requiere unos 2.500 dólares de trabajo. Después ejecutó agentes y trazó puntuación frente a gasto. Tras más de 10.000 dólares, estima el horizonte entre cero y 3.000 dólares. En términos sencillos: en este problema los agentes compiten con personas para presupuestos pequeños; las personas adelantan cuando se gasta dinero serio.
Importa menos el resultado que la forma de medir. Los benchmarks suelen informar aprobado o suspenso frente a una persona que trabajó ocho o cuarenta horas, perdiendo información y necesitando muchas pruebas para diferenciar modelos. Una curva continua de puntuación y dólares es estadísticamente más precisa, incluye el cálculo consumido y puede apuntar a problemas ya exprimidos por personas. METR aclara lo que no demuestra: es un problema, las ejecuciones son preliminares y el coste humano aproximado. Nadie debería tratar un único horizonte como veredicto sobre la capacidad investigadora de la IA.
Qué significa esto para ti: Si estás cansado de puntuaciones incomprensibles, esta métrica se puede razonar porque usa dinero. Si ya empleas agentes, la lección práctica es que suelen aportar gran valor al principio y peor valor conforme el problema se hace profundo y caro. Presupuestar así es más útil que suponer que siempre son más baratos. Cabe esperar curvas de escalado en vez de cifras únicas: una vez medido el coste con tanta claridad, cuesta volver atrás.
Fuentes
Fuentes: https://metr.org/blog/2026-07-21-expenditure-horizon/
Nvidia podría garantizar 250.000 millones de dólares para que OpenAI alquile un centro de datos
Según el Wall Street Journal, Nvidia negocia respaldar unos 250.000 millones para un campus de 10 gigavatios en Ohio que OpenAI alquilaría. Que un vendedor de chips garantice el alquiler de su cliente es inusual y revela quién asume el riesgo del auge.