Distillation
Entraîner un petit modèle sur les réponses d'un grand pour qu'il copie son comportement à moindre coût.
Construire un modèle de pointe en partant de zéro coûte une fortune. La distillation est le raccourci: on prend un modèle existant et coûteux, on lui pose d’énormes quantités de questions, et on entraîne un nouveau modèle plus petit sur ses réponses. Le petit modèle ne voit jamais les données d’entraînement d’origine ni les poids, seulement les sorties, mais il en reprend une part étonnante du comportement. Résultat: un modèle bien moins cher à construire et à faire tourner, au prix d’un peu de qualité.
Pratiquée en interne, la méthode est courante et c’est ainsi que sont fabriqués la plupart des petits modèles rapides que vous utilisez. Pratiquée d’une entreprise à l’autre, elle devient vite contentieuse, car elle permet à un laboratoire d’absorber le travail coûteux d’un rival via son interface publique. La plupart des fournisseurs l’interdisent désormais dans leurs conditions d’utilisation, plusieurs ont accusé des concurrents de le faire quand même, et les laboratoires qui s’en abstiennent le font savoir.
-
Xiaomi possède désormais le modèle ouvert le plus puissant au monde et vous pouvez simplement le télécharger
-
K2 Horizon fournit six modèles ouverts et les données de formation qui les accompagnent
-
Tencent Open-Sources Hy4, un modèle de 770 milliards de paramètres conçu pour le travail de bureau
-
Des chercheurs ont trouvé un moyen de lire les pensées cachées de Claude, ChatGPT et Gemini
-
Google a transformé un modèle fini en un modèle beaucoup plus rapide et a publié la recette
-
ByteDance, propriétaire de TikTok, formerait le plus grand modèle d'IA de Chine à ce jour
-
Les poids de Kimi K3 sont enfin publics, et ils occupent 1,4 téraoctet
-
Nadella : vous payez l’IA deux fois, d’abord avec votre argent, puis avec vos connaissances
-
Là où le réseau s’arrête, la petite IA prend le relais : de minuscules modèles sauvent des vies hors ligne