Netflix reconstruyó su motor de recomendaciones como modelo de lenguaje y ganó la prueba A/B por un 0,115 por ciento
GenRec convierte su historial de visualización en texto sin formato y permite que un modelo de peso abierto ajustado clasifique el catálogo. Superó un sistema que Netflix ha perfeccionado durante años, utilizando 40 veces menos ejemplos etiquetados.
Netflix enfrentó su sistema de recomendación de larga data con un modelo de lenguaje que construyó internamente, y el modelo de lenguaje ganó. La empresa publicó los resultados en su blog de ingeniería el 22 de agosto. El sistema se llama GenRec y su truco es casi sorprendentemente simple: en lugar de describirte con miles de números, te describe con oraciones.
El antiguo sistema se basa en miles de funciones hechas a mano, es decir, pequeñas piezas de información que los ingenieros diseñaron y codificaron a mano, como la frecuencia con la que terminas una serie o cuánto te gusta un género determinado. Ese enfoque funciona, pero su extensión es costosa. Cada vez que Netflix agrega un nuevo tipo de contenido, como juegos, formatos en vivo o podcasts, alguien tiene que crear nuevas funciones para él.
GenRec se salta ese paso. Las reproducciones, las duraciones de visualización, los pulgares hacia arriba o hacia abajo, las adiciones a la lista y el momento en que abandonó el episodio dos se escriben como texto, un poco como una conversación continua entre usted y el servicio. Un modelo de peso abierto ajustado, es decir, un modelo cuyos pesos se publican para que cualquiera pueda adaptarlos, lee ese historial y califica cada título coincidente de una sola vez. Netflix no dice desde qué modelo abierto partió.
Las cifras son modestas pero reales. Fuera de línea, GenRec obtuvo aproximadamente un 1,6 por ciento mejor que el sistema de producción, y llegó allí con aproximadamente 40 veces menos ejemplos de capacitación etiquetados en su segunda etapa de capacitación. En una prueba A/B en vivo de cuatro semanas en aproximadamente el diez por ciento del tráfico, una métrica de participación en la pantalla de inicio a corto plazo aumentó un 0,115 por ciento y una métrica central a largo plazo aumentó un 0,006 por ciento. Netflix dice que ambas ganancias son estadísticamente sólidas y no ruidosas.
¿Qué impulsa una recomendación ahora?
Aquí está la parte que vale la pena entender, porque aparece en todas partes en la IA en este momento. El trabajo ha pasado de la ingeniería de características a la ingeniería de contexto. Ya nadie diseña señales numéricas inteligentes. La pregunta es qué eventos pertenecen a la entrada del modelo y cuántos. Una versión de texto completo de su historial de visualización superaría la ventana de contexto, es decir, la cantidad de texto que un modelo puede tener en mente a la vez, por lo que Netflix filtra con fuerza: las sesiones largas permanecen con todo detalle, los toques rápidos se eliminan, los atracones se condensan. Su propio gráfico muestra que después de cierta duración, cada evento adicional apenas ayuda y solo se calculan los costos.
Dos advertencias honestas. Netflix llama a esto “un paso temprano pero prometedor” y no reemplazará el antiguo sistema. Y estos modelos se vuelven obsoletos rápidamente: un modelo base de apenas dos semanas ya pierde terreno porque no ha visto los nuevos títulos.
Qué significa esto para ti: Si usas Netflix, nada cambia hoy y un cambio del 0,115 por ciento es invisible para cualquier espectador. La parte interesante es el patrón. Un modelo de lenguaje genérico, ajustado con sus propios datos y alimentado con una porción de contexto bien elegida, está comenzando a superar a los sistemas que los especialistas pasaron años ajustando manualmente. Si ejecuta algo que clasifique o clasifique, esa es la dirección a seguir. Y si estás aprendiendo cómo funciona la IA, recuerda la frase: lo que pones en el mensaje ahora es el trabajo de diseño.
Fuentes
- GenRec: Hacia la recomendación nativa de LLM en Netflix, Blog tecnológico de Netflix
- Netflix prueba el modelo de lenguaje como alternativa a la lógica de recomendación hecha a mano, The Decoder
Fuentes: https://netflixtechblog.com/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3
Estas gafas con IA deliberadamente no tienen cámara. Ese resulta ser el punto central
Las gafas iO de RayNeo muestran texto en su campo de visión, escuchan reuniones y sugieren entradas en el calendario. Sin cámara, sin altavoz y una suscripción de 9,99 dólares para modelos que ya están desactualizados.