CourionAI
ES
Boletín
← Glosario Término

Modelo de preferencia de investigación de IA

Un método de Meta FAIR que clasifica los experimentos de aprendizaje automático propuestos entre sí, en lugar de predecir puntuaciones, para decidir en cuáles vale la pena dedicar tiempo de GPU.

Los agentes de investigación pueden sugerir muchos más experimentos de los que cualquiera puede permitirse realizar, porque proponerlos lleva unos segundos y entrenar, días. Un RPM se ubica frente a esa cola y ordena a los candidatos, luego elige el superior para ejecutarlo.

La elección de diseño que lo hace funcionar es un rechazo: nunca intenta predecir qué tan bien obtendrá un resultado un experimento, porque los modelos de lenguaje resultan poco confiables a la hora de pronosticar números absolutos. Comparar dos opciones es una pregunta mucho más fácil que valorar cualquiera de ellas, lo cual es un truco que vale la pena utilizar cada vez que le pides a un modelo que juzgue algo.