CourionAI
FR
Newsletter
← Toutes les actus
openai 3 min de lecture

OpenAI a construit sa propre puce et les premiers benchmarks sont bons

Jalapeño, la première puce d'inférence personnalisée d'OpenAI avec Broadcom, fonctionne avec 700 watts contre 900 à 1 150 pour Nvidia. Une analyse indépendante lui donne une avance de 1,5 à 1,9 fois par kilowatt.

Un petit piment dessiné comme une puce informatique avec des broches, à côté d'une prise d'alimentation enroulée beaucoup plus grande

OpenAI et Broadcom ont présenté Jalapeño lors de la conférence Hot Chips cette semaine, le premier processeur qu’OpenAI a conçu lui-même. Il s’agit d’une puce d’inférence, ce qui signifie qu’elle est conçue pour exécuter des modèles finis plutôt que pour en former de nouveaux, et les premiers benchmarks publiés la placent devant les racks actuels de Nvidia sur la mesure la plus importante pour quiconque paie une facture d’électricité.

Les gros chiffres, tirés du bulletin d’analyse des puces SemiAnalysis et des propres chiffres d’OpenAI : Jalapeño consomme 700 watts, contre 900 à 1 150 watts pour la puce de calcul Rubin de Nvidia. Sur le benchmark InferenceX de SemiAnalysis, il a fourni un débit par kilowatt 1,5 à 1,9 fois supérieur et une latence de bout en bout 1,7 à 3,6 fois inférieure à celle des systèmes rack GB200 et GB300 de Nvidia, testés sur des modèles ouverts, notamment DeepSeek R1, GPT-OSS et Kimi K2.5. Les travaux de conception ont commencé à la mi-2024, la conception a été envoyée à l’usine en novembre 2025 et elle est construite sur le processus N3P de TSMC avec une mémoire HBM4 à 15,4 To/s. Deux mises en garde figurent dans le même rapport. SemiAnalysis soutient que la comparaison équitable est la nouvelle plate-forme Vera Rubin de Nvidia plutôt que Blackwell, puisque les deux utilisent la mémoire HBM4, et sur cette base, Jalapeño est toujours en avance sur les jetons de sortie par mégawatt, mais sort à peu près égal sur le coût total par jeton.

Que se passe-t-il réellement ici : l’inférence est la destination de l’argent. La formation d’un modèle est une dépense ponctuelle, mais chaque question posée par un utilisateur coûte de l’énergie pour toujours, et à l’échelle d’OpenAI, un cinquième de la facture d’électricité représente un chiffre très important. De par sa conception, une puce personnalisée peut être plus étroite qu’un GPU à usage général : il lui suffit de bien exécuter les propres modèles d’OpenAI, de sorte que tout ce qui ne sert pas cet objectif est supprimé. C’est la raison pour laquelle Google a créé les TPU et Amazon a créé Inferentia. La partie stratégique n’est pas la référence, c’est le levier. Une entreprise disposant d’une puce interne crédible négocie avec Nvidia à partir d’une position différente, et Anthropic lisant la même page est probablement la raison pour laquelle elle vient d’embaucher le fondateur du programme TPU de Google.

Ce que cela signifie pour vous : vous ne remarquerez rien ce mois-ci, et vous ne pouvez pas en acheter un. Mais l’inférence moins chère est le mécanisme derrière presque toutes les améliorations que vous ressentez réellement : des prix d’API plus bas, des limites de niveau gratuit plus élevées, des réponses plus rapides et des modèles autorisés à réfléchir plus longtemps avant de répondre. Si vous vous basez sur des API d’IA, la chose à surveiller est de savoir si OpenAI transmet l’efficacité ou la conserve comme marge. Cela vaut également la peine d’être pris en compte : il s’agit de références de fournisseurs et d’analystes sur des modèles sélectionnés, et non de tests indépendants à grande échelle, et la réponse de Nvidia est livrée dans la même fenêtre.

Sources

Sources: https://openai.com/index/openai-broadcom-jalapeno-inference-chip/

Article suivant

Ce robot apprend une tâche de dix minutes en regardant une vidéo

Skild AI a publié S1, un modèle de robot qui copie une tâche après avoir assisté à une seule démonstration humaine, sans recyclage. Il a retourné une crêpe même s'il n'a jamais vu de crêpe se retourner à l'entraînement.

Un bras de robot retournant une crêpe dans une poêle, avec une pellicule à côté montrant le même mouvement image par image