OpenAI trouve les systèmes Cerebras, partenaire d’Helios d’AMD, “incroyables” en inférence, confirmant le bon choix d’AMD
AMD mise sur Cerebras et son Wafer-Scale Engine pour équiper ses systèmes rack Helios, un choix stratégique que vient de saluer un chercheur d’OpenAI. Jeffrey Wang a testé en interne les puces du partenaire d’AMD et les décrit comme “incroyables” pour leur vitesse d’inférence ultra-rapide. Une collaboration qui pourrait transformer la compétitivité des datacenters face à NVIDIA.
Un chercheur OpenAI encense les performances d’inférence de Cerebras
AMD a choisi son partenaire avec soin pour renforcer les capacités d’inférence de son système au niveau rack, Helios. Et un chercheur d’OpenAI vient de chanter les louanges du Wafer-Scale Engine de Cerebras.
Comme nous l’expliquions récemment, Helios est la première solution rack complète d’AMD pour les charges de travail IA. Elle associe :
- GPU AMD Instinct MI455X
- CPU AMD EPYC de 6e génération
- AMD Pensando AI Network Interface Cards (NIC)
- DPU AMD Pensando
- AMD Infinity Fabric
- Stack logiciel AMD ROCm
Pour améliorer encore l’utilité de ses systèmes Helios, AMD s’est associé à Cerebras et prévoit d’intégrer son Wafer-Scale Engine pour une infraction ultra-rapide. Le Wafer-Scale Engine place toute la mémoire et la puissance de calcul d’un supercalculateur IA sur une seule et immense feuille de silicium interconnectée, où des centaines de milliers de cœurs de calcul et des dizaines de gigaoctets de SRAM communiquent sans jamais rencontrer de goulot d’étranglement réseau externe.
Concrètement, le Wafer-Scale Engine peut contenir un modèle de taille moyenne, ou de larges portions d’un gros modèle, dans son bloc unifié de SRAM. La polyvalence de l’approche de Cerebras permet aussi bien l’entraînement que l’inférence. Selon la roadmap envisagée par AMD, Helios servira de moteur à haut débit et haute performance, tandis que la technologie Cerebras assurera un décodage et une génération de jetons ultra-rapides et à très faible latence. Ensemble, ces deux moteurs de calcul devraient offrir jusqu’à 5 fois plus de jetons par seconde et par watt.
OpenAI researcher Jeffrey Wang reveals the internal models running on Cerebras chips are so fast that tasks now finish before he even has the opportunity to context-switch, and it increases his productivity.
“Internally, we have some OpenAI models that are on Cerebras chips.… pic.twitter.com/I9DZwBzwVW
— Fireside Alpha (@firesidealpha) July 28, 2026
Le chercheur d’OpenAI, Jeffrey Wang, a généreusement loué les puces de Cerebras qui utilisent vraisemblablement son architecture Wafer-Scale Engine, déclarant :
“En interne, nous avons certains modèles OpenAI qui tournent sur les puces Cerebras. Elles sont incroyables car leur inférence est très rapide.”
Wang poursuit :
“Ce que cela signifie pour moi au quotidien, c’est que là où je devais auparavant attendre quelques minutes pour qu’une tâche se termine, elle se termine maintenant avant même que j’aie le temps de changer de contexte. Cela me rend bien plus productif.”
Pour rappel, les modèles IA changent généralement de contexte lorsqu’ils passent d’une tâche à une autre, par exemple dans un cadre multi-agent ou dans les modèles Mixture of Experts (MoE) où différents sous-réseaux neuronaux se spécialisent dans une tâche spécifique. Le fait qu’OpenAI soit déjà impressionné par les systèmes de Cerebras suggère que les systèmes rack Helios d’AMD, intégrés avec le Wafer-Scale Engine, devraient se vendre comme des petits pains dès leur lancement.
Morgan Stanley laid out the economics of AI “intelligence factories.”
Data centers that sell tokens (AI inference output) could post net margins of 58-90%, depending on the NVIDIA GPU generation running them.
Blackwell-based centers: around 59% margins.
Rubin: around 78%.… pic.twitter.com/aDdHCEFjPt— Semiconductor Insider (@SemiconductorsX) July 28, 2026
Cela devient d’autant plus important quand on considère que les coûts d’inférence sont désormais le principal déterminant de la rentabilité des datacenters.



