hypothèse du grand monde
L'argument de Richard Sutton selon lequel tout système d'apprentissage est toujours bien plus petit que le monde dans lequel il opère et doit être conçu en conséquence.
L’idée est simple et légèrement humiliante. Quoi que vous construisiez, le monde auquel il doit faire face est bien plus vaste et plus complexe que le système lui-même. Un modèle ne peut donc jamais donner une image complète de son environnement, mais seulement une image compressée et partielle, et la réponse honnête en matière de conception consiste à construire des systèmes qui continuent d’apprendre du monde plutôt que des systèmes qui tentent de terminer leur apprentissage à l’avance.
Richard Sutton l’utilise comme base pour une critique pointue des données synthétiques, matériel de formation qu’un modèle génère pour lui-même. Si le monde est d’une complexité infinie et que le modèle n’en a capturé qu’une partie, alors les données produites par le modèle proviennent de cette même partie. Vous obtenez davantage de ce qu’il sait déjà plutôt que davantage de ce qu’il ne connaît pas. D’autres soutiennent que les données synthétiques fonctionnent manifestement pour enseigner des compétences spécifiques vérifiables telles que le code et les étapes de raisonnement, ce qui est une affirmation différente de celle de savoir si elles peuvent produire quelque chose de véritablement nouveau.