CourionAI
FR
Newsletter
← Toutes les actus
ai-basics 3 min de lecture

ByteDance, propriétaire de TikTok, formerait le plus grand modèle d'IA de Chine à ce jour

Trois initiés ont déclaré au Financial Times que ByteDance dispose d'un modèle avec jusqu'à dix mille milliards de paramètres en pré-entraînement, soit trois fois la taille de Kimi K3.

Un énorme dôme en treillis de nœuds connectés en construction, éclipsant les grues et les échafaudages qui l'entourent

ByteDance, la société derrière TikTok, forme un modèle d’IA avec jusqu’à dix mille milliards de paramètres, selon un rapport du Financial Times citant trois personnes familières avec le travail. Si ce chiffre se maintient, il serait environ trois fois plus grand que le Kimi K3 de Moonshot, actuellement le plus grand modèle chinois, et placerait ByteDance dans la même catégorie de poids que le Mythos 5 d’Anthropic, que l’industrie estime à environ huit mille milliards. Anthropic n’a jamais publié son propre chiffre.

Les paramètres sont les nombres réglables à l’intérieur d’un modèle, les paramètres qu’il ajuste pendant la formation pour coder ce qu’il a appris. Plus de paramètres signifie plus d’espace pour stocker les modèles, le nombre est donc une approximation de la capacité. Rugueux est le mot clé. La qualité des données, la méthode de formation et la durée des trains de modèles sont au moins aussi importantes, et l’industrie a vu à plusieurs reprises des modèles plus petits et mieux entraînés battre des modèles plus grands et bâclés. Le paramètre de traitement compte de la même manière que vous traiteriez la cylindrée du moteur dans une voiture : informatif et non décisif.

Le modèle serait en pré-entraînement, la première phase et la plus gourmande en calcul, où il traite d’énormes quantités de texte avant tout fine-tuning. Cette phase dure généralement de trois à six mois, donc une version serait loin d’être disponible. Une source a ajouté un détail qui mérite d’être signalé : ByteDance a évité la distillation pendant plus d’un an. La distillation signifie entraîner votre modèle sur les résultats du modèle de quelqu’un d’autre, un raccourci qui vous permet d’obtenir une qualité décente à moindre coût et qui est devenu un point sensible entre les laboratoires. Choisir de ne pas l’utiliser revient à affirmer que l’on fait correctement une chose coûteuse, bien qu’il s’agisse d’une affirmation émanant d’une source anonyme plutôt que d’un fait publié.

Le tableau d’ensemble est le retour de l’échelle brute comme levier de compétitivité. Le fondateur Zhang Yiming aurait dit à l’équipe Seed de ByteDance, composée de 2 000 personnes, de viser des capacités de modèle de pointe sur le long terme. Elon Musk affirme que xAI entraîne des variantes de Grok sur six et dix mille milliards de paramètres sur son cluster Colossus 2. Après quelques années où l’efficacité et la formation intelligente étaient à la mode, plusieurs laboratoires parient une fois de plus que le plus gros, à un coût énorme, l’emportera toujours.

Ce que cela signifie pour vous: pour l’instant, rien de pratique. Ce modèle n’existe pas en tant que produit, pourrait ne jamais être commercialisé en dehors de la Chine et serait confronté à des questions d’exportation et de réglementation dans l’UE s’il l’était. Ce qui est utile, c’est l’étalonnage. Lorsque vous lirez ensuite qu’un modèle comporte un nombre de paramètres époustouflant, vous savez maintenant que le nombre décrit la capacité, pas la qualité, et que la question intéressante est de savoir sur quoi a été formé et comment. Si vous suivez les modèles à poids ouvert, gardez quand même un œil sur celui-ci : ByteDance a déjà publié des open weights, et un laboratoire chinois avec dix mille milliards de paramètres réinitialiserait les attentes de tout le monde.

Sources

Sources: https://www.ft.com/content/9b8383b1-a28d-4940-8c4e-2f0cd21556ef

Article suivant

Un développeur OpenAI déclare que ce serait le bon moment pour nettoyer vos mots de passe exposés

L’avertissement est direct : tout ce qui est sensible et disponible en public sur GitHub ou Pastebin est sur le point d’être trouvé beaucoup plus rapidement, car les modèles sont suffisamment bon marché pour être consultés partout à la fois.

Une seule clé en laiton posée dans un bassin de lumière sur le seuil d'une porte, avec une haie sombre derrière elle pleine de petits yeux observateurs