Poids du modèle
Les milliards de nombres appris par un modèle pendant son entraînement, qui constituent en pratique ses connaissances.
Les poids d’un modèle sont les nombres qu’un réseau neuronal apprend pendant l’entraînement, souvent par milliards. Ensemble, ils encodent tout ce que le modèle a appris de ses données et produisent ses réponses lorsqu’il fonctionne. Dans un sens très concret, les poids sont le modèle.
Voilà pourquoi l’expression poids ouverts est si importante. Quand un laboratoire publie les poids, il remet le système fini et exécutable, utilisable sur votre matériel. Quand ils restent privés, le modèle n’est accessible que par le service du fournisseur.
Les poids expliquent aussi le coût des modèles frontier : en produire de bons exige énormément de données et de calcul, même si exécuter ensuite le modèle fini peut être relativement bon marché.
-
K2 Horizon fournit six modèles ouverts et les données de formation qui les accompagnent
-
DeepSeek ouvre un modèle de 305 milliards de paramètres qui permet enfin de voir
-
Un tribunal australien vous fera bientôt déclarer si vous avez utilisé l'IA
-
KoboldCpp 1.120 ajoute une nouvelle façon de charger des modèles et prend en charge les modèles ouverts les plus récents
-
Les poids du GLM-5.3 sont sortis, avec deux semaines de retard et après un examen de sécurité
-
WikiSkill de Google permet aux agents IA de conserver un wiki de leurs propres erreurs
-
Tencent Open-Sources Hy4, un modèle de 770 milliards de paramètres conçu pour le travail de bureau
-
Google verrouille son propre modèle hors des questions de test
-
Two AI Rulebooks Arrived in August. Only One of Them Is Readable.
-
Anthropic veut que les agents IA fassent fonctionner les équipements de laboratoire et dispose d'une norme pour cela
-
Granite 4.2 d'IBM est gratuit, suffisamment petit pour fonctionner localement et conçu pour penser avant tout
-
Le GLM-5.3-Flash de Z.ai se rapproche d'Opus à un dixième du prix
-
Nvidia accepte d'acheter Hugging Face pour 12,9 milliards de dollars
-
Le prochain modèle ouvert d'Alibaba est un aperçu de Qwen 4
-
Ce modèle ouvert est si efficace pour trouver des bugs que son propre créateur ne le publiera pas encore
-
Anthropic a mis en œuvre son modèle le plus restreint en analysant le code à la recherche de bogues. Un humain doit encore approuver chaque correctif
-
Netflix a reconstruit son moteur de recommandation en tant que modèle linguistique et a remporté le test A/B de 0,115 %
-
Ces lunettes AI n’ont délibérément pas de caméra. Il s’avère que c’est là tout l’intérêt
-
Les modèles gratuits de Google ont dépassé le milliard de téléchargements. Certains d’entre eux fonctionnent en orbite
-
Nvidia a payé 6 milliards de dollars pour le logiciel de Poolside et 109 de ses employés, et appelle cela une licence
-
Une spin-out d'Oxford a vendu à Anthropic 250 millions de dollars de puces qui n'existent pas encore
-
Une société d’IA juridique a construit son propre modèle, et elle est partie d’un modèle chinois ouvert
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Amodei : la publicité ne réglera pas la crise de confiance de l'IA, guérir le cancer peut-être
-
Les modèles deviennent-ils volontairement moins bons en faits ?
-
GLM-5.3 est devenu bien meilleur pour attaquer des logiciels, alors Z.ai retarde ses poids
-
Qwen3.8-27B est disponible et fonctionne sur une seule carte graphique de jeu
-
Deepseek a offert son logiciel d'agent et augmenté les prix de ses API le même jour
-
Ling 3.0 Flash est le modèle ouvert le plus intelligent de sa taille, et il a arrêté d'inventer des choses
-
Le fondateur de Rocky Linux veut ouvrir la partie la plus secrète de l'IA : les données d'entraînement
-
Le créateur de Redis a créé un modèle vidéo chinois sur un Mac. Les Européens ne sont pas autorisés à l'utiliser
-
Le nouveau modèle gratuit de Nvidia n'est pas le plus intelligent. C'est juste très, très rapide
-
Meta a mis un modèle 30B sur votre ordinateur portable et Zuckerberg a utilisé le lancement pour se battre
-
Google a transformé un modèle fini en un modèle beaucoup plus rapide et a publié la recette
-
Le nouveau modèle de tempête de DeepMind offre aux prévisionnistes un jour supplémentaire, et personne ne sait vraiment pourquoi il fonctionne
-
AMD achète Taalas, une startup qui intègre un modèle d'IA complet dans la puce
-
ByteDance, propriétaire de TikTok, formerait le plus grand modèle d'IA de Chine à ce jour
-
OpenAI affirme que son prochain modèle pourrait atteindre le niveau de cyber-risque le plus élevé et a suspendu une partie du travail
-
Meta livre Muse Code, un agent de codage qui continue de fonctionner après un crash
-
Un modèle ouvert a désormais des mois, et non des années, derrière la frontière. Ses tests de sécurité ne le sont pas.
-
Quelqu'un a fait fonctionner DeepSeek V4 Flash en production sur une seule carte AMD et a publié tous les correctifs nécessaires
-
Mistral a publié un filtre de sécurité gratuit que vous décrivez en anglais simple et qui tient sur une seule carte graphique.
-
MiniMax a publié les poids de son modèle vidéo H3, et un modèle ouvert est désormais en tête d'un classement vidéo pour la première fois.
-
Qwen3.8-Max d'Alibaba a passé 16 jours à écrire un outil par lui-même, et les poids seront rendus publics la semaine prochaine
-
AMD entraîne un modèle entièrement ouvert sur ses propres puces, mais réserve les poids à la recherche
-
DeepSeek améliore son modèle économique, désormais au coude-à-coude avec celui d’OpenAI
-
Le laboratoire de Mira Murati réduit son modèle aux trois dixièmes de sa taille et ne perd qu’un point
-
Amazon cesse discrètement de développer la plupart de ses propres modèles d’IA
-
Hugging Face publie la chronologie complète de l’intrusion menée par un agent d’IA
-
Nous avons fait tourner une IA locale sur un processeur d’entrée de gamme vieux de six ans. Voici ce qu’elle sait vraiment faire.
-
Les poids de Kimi K3 sont enfin publics, et ils occupent 1,4 téraoctet
-
Avec 500 dollars d’entraînement, un modèle 9B surpasse tous les ténors sur une tâche ingrate
-
Qui est qui : Black Forest Labs, le laboratoire allemand présent dans Photoshop et Canva
-
La même quantité de texte généré : 50 dollars chez Anthropic, 87 centimes chez DeepSeek
-
Un modèle ouvert allemand avait des réponses de test dans ses données d’entraînement, et c’est grâce à son ouverture que nous le savons
-
Opus 5 d’Anthropic est plus petit et moins cher, mais surpasse son grand frère
-
FLUX 3 veut réunir images, vidéo, audio et même actions robotiques dans un seul modèle
-
DeepSeek V4 devient pleinement stable, les anciens modèles s’arrêtent aujourd’hui
-
Ein kleines offenes Coding-Modell schlägt zehnmal größere Konkurrenten, und du kannst es selbst ausführen
-
Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift
-
Samsung discute d’un soutien à Mistral, poussant le champion européen de l’IA vers une valorisation de 20 milliards d’euros
-
Alibaba présente Qwen3.8 Max et promet de donner les poids
-
Google construirait une puce dont l'architecture de Gemini serait gravée dans le silicium
-
Un nouveau benchmark médical demande si l'IA sait quand elle ne sait pas
-
Les États-Unis veulent examiner les nouveaux modèles de pointe pendant 30 jours avant leur sortie : ce que cela signifie réellement
-
Le plus grand modèle d’IA gratuit à ce jour arrive le 27 juillet. Mais que signifie vraiment « poids ouverts » ?
-
Kimi K3 : un modèle téléchargeable gratuitement qui talonne presque les grands noms
-
Le nouveau laboratoire de Mira Murati lance son premier modèle, conçu pour être personnalisé
-
Un modèle d’IA performant qui tient sur votre téléphone et fonctionne entièrement hors ligne
-
DeepSeek cherche de nouveaux milliards quelques semaines après sa première levée : l’IA bon marché coûte cher
-
Un lauréat du prix Turing parie contre l’apprentissage profond avec sa nouvelle entreprise, Oak Lab
-
Soofi S : l’Allemagne possède désormais un modèle d’IA ouvert en tête des classements open source
-
Les chiffres indépendants sont arrivés : Muse Spark 1.1 de Meta offre un rapport qualité-prix sérieux
-
Pourquoi Databricks vient d’adopter un modèle chinois open source comme moteur de programmation au quotidien
-
Meta entre dans la guerre des prix de l’IA avec Muse Spark 1.1 et sa première API pour développeurs
-
MiniMax préparerait un modèle open source de 2 700 milliards de paramètres
-
Mistral se lance dans la robotique : une seule caméra suffit pour diriger un robot
-
Là où le réseau s’arrête, la petite IA prend le relais : de minuscules modèles sauvent des vies hors ligne
-
L’« Unlimited OCR » de Baidu lit des documents de 40 pages d’un seul coup, en apprenant à oublier
-
Le patron de Mistral prévient : les modèles d’IA fermés sont aux premières loges de votre entreprise
-
Pourquoi un outil de programmation par IA s’est retrouvé au cœur du bras de fer entre les États-Unis et la Chine, et ce qu’il nous apprend
-
Tesla plafonne à 200 dollars par semaine les dépenses d’IA de ses salariés, le signe d’une facture que personne n’avait anticipée
-
MiniMax M3 : un modèle d’IA haut de gamme que vous pouvez télécharger et exécuter vous-même
-
Le gouvernement américain veut voir les nouveaux modèles d’IA 30 jours à l’avance, « volontairement »