CourionAI
FR
Newsletter
← Toutes les actus
hardware 2 min de lecture

AMD et Cerebras s’associent pour accélérer les réponses de l’IA

Deux fabricants de puces se répartissent le travail d’exécution d’un modèle d’IA pour réduire la latence et améliorer l’efficacité énergétique. Voici la version en langage clair.

Illustration en risographie d’une grande baie de serveurs et d’une plaquette de silicium ronde reliées par un trait de lumière et partageant une tâche

AMD et Cerebras ont annoncé cette semaine un partenariat pour exécuter les modèles d’IA plus rapidement en répartissant le travail entre deux types de puces très différents. Cela ressemble à de la plomberie matérielle complexe, mais l’objectif est très concret : réduire le délai entre le moment où vous appuyez sur Entrée et celui où la réponse commence à apparaître.

Voici l’idée en termes simples. Quand un modèle d’IA vous répond, il accomplit deux tâches. Il lit et assimile d’abord votre demande, ainsi que les documents ou l’historique qui l’accompagnent. Puis il rédige la réponse, morceau par morceau. Ces deux tâches n’ont pas les mêmes besoins. Lire une longue demande est une tâche de masse qui bénéficie d’un débit élevé ; écrire la réponse mot après mot exige surtout une grande vitesse à chaque étape. Les racks « Helios » d’AMD, construits avec ses processeurs EPYC et ses GPU Instinct, s’occuperont de la lecture et pourront traiter beaucoup de grosses demandes à la fois. Cerebras, connue pour une puce de la taille d’une assiette, un « wafer-scale engine », autrement dit un seul processeur géant plutôt que de nombreux petits processeurs reliés, prendra en charge l’écriture et produira les tokens avec très peu de délai. AMD et Cerebras affirment que ce partage offre jusqu’à cinq fois plus d’efficacité énergétique. Le service commun devrait d’abord arriver sur Cerebras Cloud au second semestre de cette année.

Alors, que se passe-t-il vraiment ? L’industrie de l’IA a passé des années à construire des modèles toujours plus grands. La nouvelle course consiste à bien les servir : rapidement, à moindre coût et sans brûler des quantités absurdes d’énergie. Les architectures « désagrégées » comme celle-ci, qui utilisent la bonne puce pour chaque partie de la tâche plutôt qu’une seule pour tout faire, sont une grande partie de la réponse. C’est aussi un moment important pour Cerebras, longtemps outsider atypique dans un monde dominé par Nvidia, et pour AMD, qui a récemment signé un accord d’inférence distinct avec Anthropic. Une réserve s’impose : ces performances sont annoncées par les entreprises elles-mêmes, et le produit commun n’est pas encore sorti. Les chiffres réels restent donc à vérifier.

Ce que cela signifie pour vous : Vous ne verrez jamais une puce AMD ou Cerebras, et vous n’en avez pas besoin. Quand l’assistant que vous utilisez répond plus vite ou qu’un fournisseur baisse ses prix, c’est ce type de travail en coulisses qui le rend possible. Un service plus rapide et moins cher transforme une démonstration impressionnante en outil que vous avez réellement envie d’utiliser toute la journée. Pour la plupart des gens, rien ne change aujourd’hui ; c’est simplement un bon signe pour l’évolution de cette infrastructure invisible.

Sources

Sources: https://www.cerebras.ai/press-release/amd-and-cerebras-announce-industry-leading-ultra-low-latency-and-high-throughput-ai-inference

Article suivant

Les nouvelles règles chinoises sur les compagnons IA viennent d’entrer en vigueur. Voici ce qu’elles changent

De nouvelles règles chinoises sur les applications de « compagnons » IA sont entrées en vigueur la semaine dernière. Elles interdisent les chatbots romantiques pour les mineurs et imposent des garde-fous contre la dépendance. Voici ce qui change et pourquoi le monde les observe.

Illustration en risographie d’une bulle de dialogue en forme de cœur derrière une barrière basse, à côté d’une petite horloge