La respuesta de Meta al tiempo desperdiciado en la GPU: pregunte a un modelo qué experimento ejecutar
Investigadores de Meta FAIR, Oxford y UCL introdujeron modelos de preferencia de investigación de IA, que clasifican los experimentos de aprendizaje automático no ejecutados entre sí en lugar de predecir puntuaciones, para decidir dónde gastar la computación.
Un artículo del laboratorio FAIR de Meta con la Universidad de Oxford y el University College de Londres aborda un problema que suena mundano y cuesta una fortuna: los agentes de investigación de IA pueden proponer muchos más experimentos de los que cualquiera puede permitirse realizar. Pensar en un candidato lleva unos segundos. En realidad, entrenar el modelo para saber si funciona puede llevar horas o días de tiempo de GPU. Así que el cuello de botella no son las ideas, sino la elección.
Su propuesta se llama Modelo de Preferencia de Investigación de IA, o RPM, y la parte inteligente es lo que se niega a hacer. No predice qué tan bien obtendrá la puntuación de un experimento, porque el equipo encontró que los modelos de lenguaje no son confiables para pronosticar números absolutos o resultados de ejecución. En lugar de eso, trata el problema como una clasificación: dado un conjunto de experimentos candidatos que aún no se han ejecutado, ponlos en orden y elige el mejor. Comparar dos opciones es una pregunta mucho más fácil que estimar el valor de cualquiera de ellas, y es un truco que aparece en todo el aprendizaje automático. El equipo creó dos versiones a partir de modelos de lenguaje congelados previamente entrenados, es decir, modelos utilizados tal como están sin capacitación adicional. Uno razona exclusivamente sobre los planes candidatos, el código y los resultados de los experimentos ya realizados. El otro además ejecuta experimentos piloto a pequeña escala antes de clasificar, gastando un poco de cómputo para ahorrar mucho.
Por qué esto importa más de lo que parece. Casi todas las historias sobre la automatización de la investigación de IA tratan sobre agentes que generan y ejecutan. Muy poco se trata de agentes que declinan. A medida que los laboratorios apuntan a sistemas más autónomos para sus propias investigaciones, la restricción deja de ser cuántas ideas puede tener el sistema y pasa a ser qué tan bueno es su sabor, y el sabor es exactamente lo que nadie ha sabido medir. Enmarcarlo como una clasificación de preferencias lo convierte en algo que puedes entrenar y evaluar. También se conecta directamente con los números que OpenAI publicó esta semana sobre el tiempo de ejecución del agente que excede el trabajo humano en tres a uno: el tiempo de ejecución solo vale algo si los experimentos valieron la pena, y un laboratorio que quema tres días-agente por día humano tiene un interés obvio en no desperdiciarlos.
Lo que esto significa para usted. Para la mayoría de los lectores, esto es un contexto más que algo sobre lo que actuar, y está bien archivarlo de esa manera. Pero la idea subyacente va mucho más allá de los grupos de GPU. Si alguna vez le pidió a un modelo que calificara sus opciones sobre diez y obtuvo un conjunto de ochos sospechosamente plano, se encontró con el mismo fracaso que los investigadores. En su lugar, pedirle que clasifique o compare dos cosas a la vez tiende a producir respuestas que realmente puede utilizar. Esta es una mejora gratuita en la forma de dar indicaciones y proviene de la misma observación que en el artículo.
Fuentes
Fuentes: https://arxiv.org/abs/2608.13940
OpenAI dice que sus agentes de codificación ahora trabajan tres días por cada día humano
OpenAI publicó cifras internas que muestran que su organización de investigación utiliza 3,1 días laborables de agente de tiempo de ejecución del agente de codificación por cada día de trabajo humano, y dice que ha alcanzado su objetivo de tener un pasante de investigación automatizado para septiembre.