CourionAI
FR
Newsletter
← Toutes les actus
open-source 3 min de lecture

K2 Horizon fournit six modèles ouverts et les données de formation qui les accompagnent

L'Institut des modèles de base d'Abu Dhabi a publié le 3 septembre six modèles allant de 0,9 à 375 milliards de paramètres sous Apache 2.0, publiant les poids, le code, les données de formation et la méthodologie. Le plus petit est destiné à fonctionner sur une montre.

Six sommets de montagne s'élevant en taille croissante, chacun dessiné comme un fil de fer transparent pour que la structure interne transparaît

Alors que quatre laboratoires commerciaux expédiaient des modèles frontières la semaine dernière, un institut de recherche d’Abou Dhabi en a publié six et a fait quelque chose que les grands laboratoires ne font pas : il a publié les données de formation en même temps. L’Institute of Foundation Models, qui fait partie de l’Université d’intelligence artificielle Mohamed bin Zayed, a lancé K2 Horizon le 3 septembre sous la licence Apache 2.0, qui est à peu près aussi permissive que les licences logicielles.

La flotte couvre entre 0,9 milliard et 375 milliards de paramètres. Les paramètres sont les nombres réglables à l’intérieur d’un modèle, et un plus grand nombre d’entre eux signifie généralement plus de capacités et plus de matériel nécessaire pour l’exécuter. Il existe des modèles denses à 0,9B, 3,7B, 7B et 32B, ainsi que deux modèles de mélange d’experts clairsemés à 36B avec 4B actif et 375B avec 23B actif. Sparse signifie que seule une fraction du modèle se réveille pour une question donnée, de sorte qu’un modèle 375B peut coûter plus cher qu’un modèle 23B à exécuter. IFM vise le modèle 0,9B pour les montres et les lunettes, les 3,7B et 7B pour les téléphones, les 32B et 36B pour les ordinateurs portables et les serveurs sur site, et le produit phare 375B pour le travail en entreprise. IFM affirme que les modèles 0,9B, 3,7B et 7B établissent un nouvel état de l’art dans leurs tailles. Deux notes techniques de la version : une méthode de « distillation par diffusion » qui génère des blocs de jetons en parallèle pour une accélération d’environ 3 fois, et une architecture de mélange de valeur et d’attention destinée à améliorer le raisonnement sans calcul supplémentaire.

Pourquoi « entièrement ouvert » n’est pas la même chose que « poids ouverts ». La plupart des modèles appelés ouverts, y compris Llama et DeepSeek, publient les poids : les nombres finis dont vous avez besoin pour faire fonctionner l’appareil. Ils ne publient pas ce qui a été suivi par la formation, ce qui signifie que vous pouvez utiliser le modèle mais que vous ne pouvez pas le vérifier, le reproduire ou étudier pourquoi il se comporte comme il le fait. Le fondateur de l’IFM, Eric Xing, a clairement fait la distinction, affirmant que la science fonctionne lorsque d’autres peuvent voir les données, suivre la méthode et reproduire le résultat. La question de savoir si les modèles résistent aux meilleures versions à poids ouvert est une question qui fera l’objet de tests indépendants au cours des prochaines semaines, et les tests de référence autodéclarés par n’importe quel laboratoire méritent le même scepticisme. Mais l’allégation de transparence est vérifiable, contrairement aux scores de référence, ce qui est plutôt le problème.

Ce que cela signifie pour vous. Si vous souhaitez exécuter un modèle performant sur votre propre ordinateur plutôt que d’envoyer votre texte au serveur de quelqu’un d’autre, les modèles 7B et 32B sont ceux à regarder, et ils sont sur Hugging Face avec la prise en charge de vLLM, SGLang et Ollama ainsi que les versions GGUF, qui est le format souhaité par la plupart des outils de bureau. Un modèle 7B fonctionne confortablement sur un ordinateur portable décent. Si vous étudiez ou enseignez, les données de formation publiées en font la famille de modèles sérieux la plus inspectable disponible à l’heure actuelle, ce qui est important si votre question est “pourquoi a-t-il dit cela” plutôt que “qu’est-ce qu’il a dit”. Pour tous les autres : rien ne change aujourd’hui, mais un modèle entièrement reproductible à cette échelle donne aux chercheurs un outil qu’ils réclament depuis 2023.

Sources

Sources: https://ifm.ai/k2/press-release/

Article suivant

Le niveau de modèle le moins cher de Meta coûte 21 fois moins cher et s'entraîne selon vos invites

Meta a publié Muse Spark 1.3 le 2 septembre au prix standard inchangé, ainsi qu'un niveau de contributeur à 0,10 $ par million de jetons d'entrée dans lequel Meta utilise vos invites et vos sorties pour améliorer ses produits.

Une balance à deux plateaux avec des pièces empilées d'un côté et des feuilles de papier volantes basculant l'autre côté vers le bas