Rich Sutton, pionero del aprendizaje por refuerzo, califica los datos sintéticos como un gran error
Sutton sostiene que no se puede aprender un mundo de complejidad infinita a partir de los datos que un modelo genera por sí mismo. Es un desafío directo a uno de los atajos favoritos de la industria.
Rich Sutton, una de las figuras fundadoras del aprendizaje por refuerzo y coautor del libro de texto estándar en este campo, ha calificado los datos sintéticos como un “gran error” dado lo complejo que es el mundo real. El comentario, publicado el 20 de agosto, apunta directamente a una práctica que silenciosamente se ha convertido en un estándar en toda la industria.
Los datos sintéticos son exactamente lo que parecen: material de entrenamiento que un modelo genera por sí mismo, o que otro modelo genera para él, en lugar de texto e imágenes recopiladas del mundo. Los laboratorios dependen en gran medida de ellos porque los datos reales son finitos, costosos, legalmente complicados y cada vez más limpios. La objeción de Sutton se conecta con una idea que ha defendido durante años, la hipótesis del gran mundo: cualquier sistema de aprendizaje es siempre mucho más pequeño que el entorno en el que opera, por lo que nunca podrá contener un modelo completo de ese mundo. Si eso es cierto, entonces un sistema que genera su propio material de capacitación está extrayendo de la parte del mundo que ya ha capturado, que es por definición la parte pequeña. Obtienes más de lo que el modelo ya sabe, no más de lo que no sabe.
Esta no es una posición marginal, pero sí controvertida y encaja en un argumento más amplio que se ha intensificado en las últimas semanas. Los matemáticos Timothy Gowers y Peter Sarnak han dicho por separado que los modelos de lenguaje combinan bien los métodos conocidos, pero tienen dificultades para inventar fundamentos genuinamente nuevos. Un artículo de DeepMind argumentó el mismo cuello de botella desde una dirección diferente. El argumento contrario es sencillo y tiene evidencia detrás: se ha demostrado que los datos sintéticos funcionan para enseñar habilidades específicas, particularmente pasos de razonamiento y código, donde se puede verificar una respuesta correcta automáticamente. Lo que Sutton cuestiona no es si ayuda en los puntos de referencia, sino si alguna vez podrá producir algo genuinamente nuevo, y esas son afirmaciones diferentes que a menudo se argumentan como si fueran una sola.
Qué significa esto para ti: nada práctico y todo sobre cómo leer la próxima ronda de anuncios. Cuando un laboratorio informa un salto en un punto de referencia, vale la pena saber si la ganancia provino de nueva información sobre el mundo o de un modelo que practica contra sí mismo. Ambas son mejoras reales, pero sólo una de ellas le indica que el sistema ahora sabe algo que antes no sabía. Si se utilizan estas herramientas a diario, el argumento de Sutton también explica una frustración familiar: los modelos son excelentes para recombinar lo que existe y notablemente más débiles en el momento en que se necesita algo sin precedentes.
Fuentes
La IA podría escribir como un humano. La capacitación en seguridad es lo que lo delata
El CTO de Pangram sostiene que los modelos de lenguaje son detectables no porque carezcan de capacidad sino porque el entrenamiento posterior limita la forma en que se expresan. El efecto tiene un nombre: colapso del modo.