NVIDIA Nemotron 3.5 Lightning accélère la génération de tokens par 4x mais les tâches agentiques ne gagnent que 30%, l’orchestration reste le vrai goulot
NVIDIA accélère la course aux modèles open-weight avec le lancement du Nemotron 3.5 Lightning, un modèle conçu pour gérer des agents spécialisés. Cette annonce survient juste après celle de Meta et de son Muse Glimmer, mais le nouveau venu peine à s’attaquer au vrai goulot d’étranglement : la couche d’orchestration. Pourtant, la firme promet des gains de vitesse spectaculaires sur la génération de tokens.
NVIDIA veut résoudre le goulot d’étranglement des tokens, mais le vrai frein reste l’orchestration
Introducing NVIDIA Nemotron 3.5 Lightning⚡
An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster.
It delivers up to 4x the output speed of similar-sized models. pic.twitter.com/ENWrZe76pU
— NVIDIA AI (@NVIDIAAI) August 11, 2026
Comme annoncé, NVIDIA a lancé le Nemotron 3.5 Lightning, un modèle open-weight de type mixture-of-experts (MoE) avec 30 milliards de paramètres (dont 3 milliards actifs). Il est taillé pour orchestrer des agents toujours allumés, qui ingèrent un flux constant de tâches répétitives. Pour ceux qui ne le sauraient pas, l’orchestration désigne la coordination de plusieurs agents d’IA spécialisés afin qu’ils travaillent ensemble sur des problèmes complexes en plusieurs étapes, là où un seul agent ne suffirait pas. Cette orchestration au niveau agent implique plusieurs phases : réception et décomposition des tâches, sélection de l’agent, partage du contexte et de l’état (quand l’agent A termine son étape, l’orchestrateur transmet le résultat et les données utiles à l’agent B pour ne jamais repartir de zéro), puis validation et correction d’erreurs périodiques. À noter que l’orchestration au niveau matériel se déroule dans le CPU, qui gère les flux de données entre la mémoire et les cœurs de calcul pour minimiser la latence et maximiser le débit.
Éléments d’architecture
Le Nemotron 3.5 Lightning repose sur quatre piliers architecturaux :
- Hybride Mamba-Transformer : il associe la compréhension profonde du contexte propre aux Transformers à la rapidité et à l’efficacité matérielle des State Space Models (Mamba). Les Transformers sont des réseaux de neurones profonds conçus pour traiter des séquences et comprendre les relations entre leurs composants, tandis que les State Space Models sont des frameworks mathématiques qui modélisent et prédisent l’évolution de systèmes dynamiques complexes.
- Prédiction multi-tokens (MTP) : au lieu de prédire le texte mot à mot (un token à la fois), le modèle anticipe plusieurs tokens simultanément, ce qui réduit le temps de génération.
- Mixture of Experts latente (MoE) : un système de routage qui étend dynamiquement le nombre de réseaux « experts » disponibles lors de l’inférence, améliorant les performances sans explosion du coût de calcul. Concrètement, un modèle MoE contient plusieurs réseaux de neurones, chacun excellent dans une tâche spécifique, et l’orchestrateur choisit celui qui convient le mieux à chaque sous-tâche.
- Décodage spéculatif : un petit modèle « brouillon » plus rapide devine d’abord le texte, puis le modèle principal le vérifie instantanément, ce qui accélère radicalement le débit. C’est la même approche que celle utilisée par Muse Glimmer de Meta pour accélérer la génération de tokens.
Pourquoi le Nemotron 3.5 Lightning offre des rendements décroissants
NVIDIA released software this morning built to consume fewer tokens and push work away from expensive models.
The announcement covered two things. Nemotron 3.5 Lightning is a 30B parameter MoE model with 3B active parameters, distilled down from Nemotron 3 Ultra and aimed at… https://t.co/hPG3DRohx3
— Ryan Shrout (@ryanshrout) August 11, 2026
Le Nemotron 3.5 Lightning obtient un score de 24 sur l’Artificial Analysis Intelligence Index, un indice composite conçu pour évaluer les capacités globales des LLM à mesure qu’ils se rapprochent de l’AGI. Ce score mesure les capacités agentiques, de codage, de raisonnement scientifique et polyvalentes. C’est une nette amélioration par rapport à son prédécesseur, le Nemotron 3 Nano. Pourtant, si NVIDIA affirme que le Nemotron 3.5 Lightning génère des tokens 4 fois plus vite que des modèles de taille comparable, l’accélération des tâches agentiques n’est que de 30 %. En d’autres termes, le modèle quadruple le débit de tokens mais n’offre qu’un gain marginal sur les tâches d’orchestration. Cela suggère que le vrai goulot d’étranglement se situe dans la couche d’orchestration et le harnais des agents, c’est-à-dire le logiciel qui décide quoi exécuter, où et dans quel ordre.
NVIDIA is developing Nemotron 4, a new open-source AI model expected to have at least 1 trillion parameters.$NVDA is aiming for it to compete with the world’s best open models, while using open source to broaden AI adoption and ultimately drive more demand for its GPUs.
The… pic.twitter.com/A2gXuIkfol
— Wall St Engine (@wallstengine) August 11, 2026
Si le Nemotron 3.5 Lightning apporte une amélioration indéniable, il lui manque le supplément d’âme nécessaire pour propulser les modèles open-weight américains au premier plan. Ce constat explique sans doute pourquoi NVIDIA prépare déjà le terrain pour le Nemotron 4, présenté comme son prochain grand pari.



