OpenAI trouve les systèmes Cerebras, partenaire d’Helios d’AMD, “incroyables” en inférence, confirmant le bon choix d’AMD

AMD mise sur Cerebras et son Wafer-Scale Engine pour équiper ses systèmes rack Helios, un choix stratégique que vient de saluer un chercheur d’OpenAI. Jeffrey Wang a testé en interne les puces du partenaire d’AMD et les décrit comme “incroyables” pour leur vitesse d’inférence ultra-rapide. Une collaboration qui pourrait transformer la compétitivité des datacenters face à NVIDIA.

Un chercheur OpenAI encense les performances d’inférence de Cerebras

AMD a choisi son partenaire avec soin pour renforcer les capacités d’inférence de son système au niveau rack, Helios. Et un chercheur d’OpenAI vient de chanter les louanges du Wafer-Scale Engine de Cerebras.

Comme nous l’expliquions récemment, Helios est la première solution rack complète d’AMD pour les charges de travail IA. Elle associe :

  1. GPU AMD Instinct MI455X
  2. CPU AMD EPYC de 6e génération
  3. AMD Pensando AI Network Interface Cards (NIC)
  4. DPU AMD Pensando
  5. AMD Infinity Fabric
  6. Stack logiciel AMD ROCm

Pour améliorer encore l’utilité de ses systèmes Helios, AMD s’est associé à Cerebras et prévoit d’intégrer son Wafer-Scale Engine pour une infraction ultra-rapide. Le Wafer-Scale Engine place toute la mémoire et la puissance de calcul d’un supercalculateur IA sur une seule et immense feuille de silicium interconnectée, où des centaines de milliers de cœurs de calcul et des dizaines de gigaoctets de SRAM communiquent sans jamais rencontrer de goulot d’étranglement réseau externe.

Concrètement, le Wafer-Scale Engine peut contenir un modèle de taille moyenne, ou de larges portions d’un gros modèle, dans son bloc unifié de SRAM. La polyvalence de l’approche de Cerebras permet aussi bien l’entraînement que l’inférence. Selon la roadmap envisagée par AMD, Helios servira de moteur à haut débit et haute performance, tandis que la technologie Cerebras assurera un décodage et une génération de jetons ultra-rapides et à très faible latence. Ensemble, ces deux moteurs de calcul devraient offrir jusqu’à 5 fois plus de jetons par seconde et par watt.

À lire :  Les ventes de puces chinoises devraient atteindre 5 millions d'unités cette année

Le chercheur d’OpenAI, Jeffrey Wang, a généreusement loué les puces de Cerebras qui utilisent vraisemblablement son architecture Wafer-Scale Engine, déclarant :

“En interne, nous avons certains modèles OpenAI qui tournent sur les puces Cerebras. Elles sont incroyables car leur inférence est très rapide.”

Wang poursuit :

“Ce que cela signifie pour moi au quotidien, c’est que là où je devais auparavant attendre quelques minutes pour qu’une tâche se termine, elle se termine maintenant avant même que j’aie le temps de changer de contexte. Cela me rend bien plus productif.”

Pour rappel, les modèles IA changent généralement de contexte lorsqu’ils passent d’une tâche à une autre, par exemple dans un cadre multi-agent ou dans les modèles Mixture of Experts (MoE) où différents sous-réseaux neuronaux se spécialisent dans une tâche spécifique. Le fait qu’OpenAI soit déjà impressionné par les systèmes de Cerebras suggère que les systèmes rack Helios d’AMD, intégrés avec le Wafer-Scale Engine, devraient se vendre comme des petits pains dès leur lancement.

Cela devient d’autant plus important quand on considère que les coûts d’inférence sont désormais le principal déterminant de la rentabilité des datacenters.

À lire :  NVIDIA RTX 5060 bondit de 75€ en Chine, la hausse des kits mémoire affecte tout le marché GPU

Guide Optimisation Pc Windows 11 Jeux Performance Bot Guide Optimisations Pc Windows 10 Jeux Performances Sur Omgpu.com Bot

Guide Comment Reduire Input Lag Latence Omgpu Bot Comment supprimer Coil Whine carte graphique

Vous pourriez aussi aimer