Aprendizaje por refuerzo
Un método de entrenamiento en el que un modelo es recompensado por buenos intentos en lugar de recibir respuestas correctas.
El aprendizaje por refuerzo se entrena mediante prueba, error y recompensa. En lugar de mostrar respuestas correctas para copiar, evalúa las pruebas y mueve el modelo hacia resultados con mayores recompensas. El reciente salto en la calidad en los modelos de Reasoning proviene principalmente de esto, no de modelos más grandes.
El método necesita una señal confiable de verdadero o falso. El código se compila o no, las pruebas matemáticas son correctas o no. Los correos electrónicos discretos o las decisiones comerciales carecen de evaluación automática. Por eso los modelos parecen desiguales: la formación fue especialmente intensiva y fácil de calificar.
-
Ver su propio modelo ahora le cuesta a OpenAI un 20 por ciento más y detuvo una ejecución de entrenamiento para hacerlo
-
OpenAI congeló su propio entrenamiento durante dos semanas y ahora vigila sus modelos como un halcón
-
Google convirtió un modelo terminado en uno mucho más rápido y publicó la receta
-
Qwen3.8-Max de Alibaba pasó 16 días escribiendo una herramienta por sí solo, y los pesos se harán públicos la próxima semana
-
Un investigador deja OpenAI a los ocho meses porque apuesta por mejores datos, no por modelos más grandes
-
Un entrenamiento de 500 dólares permite a un modelo 9B superar a los modelos punteros en una tarea rutinaria
-
Un ganador del Premio Turing apuesta contra el aprendizaje profundo con su nueva startup Oak Lab
-
Mistral entra en la robótica: una sola cámara basta para dirigir un robot