Le nouveau mode ultrarapide d'OpenAI exécute son meilleur modèle 14 fois plus rapidement
Un nouveau niveau d'API OpenAI optimisé par Cerebras exécute GPT-5.6 Sol jusqu'à 750 jetons de sortie par seconde. Même modèle, même qualité, environ quatorze fois plus rapide, pour un petit groupe de clients d'abord.
OpenAI a présenté jeudi un nouveau niveau de service appelé Ultrafast, qui exécute GPT-5.6 Sol, son modèle le plus performant, jusqu’à quatorze fois la vitesse habituelle. En chiffres concrets, cela représente jusqu’à 750 jetons de sortie par seconde. Les jetons sont les morceaux de texte qu’un modèle produit, environ trois quarts de mot chacun, donc 750 par seconde est plus rapide que ce que n’importe quel humain peut lire. Le matériel derrière lui provient de Cerebras, le fabricant de puces dont les processeurs sont construits sur une seule énorme plaquette au lieu de plusieurs petites puces.
Ce que veut dire OpenAI, c’est qu’il s’agit du même modèle, et non d’un modèle plus petit. Jusqu’à présent, le moyen d’obtenir une réponse rapide consistait à opter pour un modèle plus léger et à accepter qu’il serait moins efficace pour les problèmes difficiles. Ultrafast conserve l’intelligence et supprime l’attente. OpenAI rapporte une accélération de bout en bout de 5,6 fois sur GDPval, une référence construite autour d’un travail de connaissances économiquement précieux, sans baisse de qualité mesurable. Cerebras affirme que la configuration est cinq fois plus rapide que Claude Opus 4.8 et onze fois plus rapide que Claude Fable 5.
Les premiers clients décrivent ce qui change lorsque le délai disparaît. Podium l’utilise dans un produit vocal, où attendre trois secondes pour obtenir une réponse à un appel téléphonique fait la différence entre une conversation et un silence gênant. Le cabinet de recherche financière Rogo affirme que les recherches complexes commencent à ressembler à une interaction en temps réel. Au sein d’OpenAI, les ingénieurs l’utilisent pendant les pannes : lorsqu’une alerte se déclenche, le modèle lit les journaux, analyse les traces et suggère les prochaines vérifications pendant que le système se comporte toujours mal, plutôt qu’après. Les chercheurs décrivent un lot d’expériences nocturnes se décomposant en plusieurs cycles au cours d’une seule journée de travail.
Que se passe-t-il réellement ici
La vitesse devient tranquillement son propre axe de compétition. Pendant deux ans, l’industrie a fait la course à la capacité, et les modèles sont devenus suffisamment intelligents pour que, pour de nombreux travaux, le goulot d’étranglement restant ne soit pas “peut-il le faire” mais “sera-t-il répondre avant que le moment ne passe”. Un modèle qui prend quarante secondes ne peut pas tenir une conversation téléphonique, ne peut pas aider en cas de panne, ne peut pas rester dans un flux de paiement. Pour y parvenir, il faut du silicium spécialisé, c’est pourquoi OpenAI s’appuie sur Cerebras plutôt que de le faire en interne, et cela rappelle que l’histoire de l’IA concerne autant les puces que les modèles. Une mise en garde juste : il s’agit d’un aperçu limité pour les clients sélectionnés, OpenAI n’a pas publié de prix et “jusqu’à 750 jetons par seconde” est un plafond, pas une moyenne.
Ce que cela signifie pour vous: rien aujourd’hui, et c’est très bien. Il s’agit d’un niveau API pour les entreprises, pas d’un bouton dans ChatGPT. Ce qu’il vous indique, c’est où vont les produits que vous utilisez. Des assistants vocaux qui ne laissent plus de blancs, des chats qui résolvent quelque chose au lieu de stagner, des outils de codage qui suivent le rythme de votre frappe : ce sont tous des problèmes de vitesse, et ils sont en train d’être résolus. Lorsque le chatbot de votre banque cesse soudainement de ressembler à une file d’attente, c’est le genre de changement qui se cache en dessous.
Sources
Suno Studio 2.0 vous permet de parler à un studio de musique comme s'il s'agissait d'un membre d'un groupe
Suno a transformé son générateur de musique en un outil de production piloté par chat : créez des instruments et des plugins en tapant, importez du MIDI, exportez du multipiste 32 bits illimité. La politique d'exportation se situe étrangement à côté des limites anti-spam de la semaine dernière.