CourionAI
ES
Boletín
← Glosario Término

Aprendizaje por refuerzo

Un método de entrenamiento en el que un modelo es recompensado por buenos intentos en lugar de recibir respuestas correctas.

El aprendizaje por refuerzo se entrena mediante prueba, error y recompensa. En lugar de mostrar respuestas correctas para copiar, evalúa las pruebas y mueve el modelo hacia resultados con mayores recompensas. El reciente salto en la calidad en los modelos de Reasoning proviene principalmente de esto, no de modelos más grandes.

El método necesita una señal confiable de verdadero o falso. El código se compila o no, las pruebas matemáticas son correctas o no. Los correos electrónicos discretos o las decisiones comerciales carecen de evaluación automática. Por eso los modelos parecen desiguales: la formación fue especialmente intensiva y fácil de calificar.