NVIDIA étend l’IA locale simplifiée aux GPU avec 24+ Go de VRAM, les optimisations vLLM et llama.cpp augmentent les performances jusqu’à 1.9x

NVIDIA continue d’accélérer et de simplifier l’IA locale. Le constructeur annonce des gains de performances significatifs pour ses GPU grand public et professionnels, ainsi qu’une prise en charge simplifiée pour plusieurs agents populaires.

Des performances locales qui s’accélèrent

NVIDIA annonce des gains de vitesse pour les agents IA fonctionnant localement, grâce à des optimisations développées avec les communautés open-source de llama.cpp et vLLM. Les mesures réalisées avec SpeedBench-Coding 8K Throughput et AIPerf sont éloquentes.

Sur les plateformes RTX grand public, comme la future GeForce RTX 5090, llama.cpp offre désormais jusqu’à 50% de débit de tokens supplémentaire sur le modèle Qwen3.6-27B, et une accélération de 90% sur le Qwen3.6-35B.

La carte professionnelle RTX PRO 6000 Blackwell bénéficie également d’un coup de boost avec vLLM, affichant jusqu’à 20% de vitesse en plus sur les deux modèles testés.

Enfin, les plateformes DGX Spark voient leurs performances augmenter de 1,4 fois sur Qwen3.6-27B avec vLLM et de 20% sur DeepSeek v4 Flash pour l’inférence. Ces optimisations de noyau améliorent les techniques de décodage spéculatif et accélèrent le pré-remplissage. Sur vLLM, les nouveaux noyaux d’attention XQA de FlashInfer et les optimisations backend contribuent à cette accélération.

Parallèlement à ces gains de vitesse, NVIDIA travaille aussi à simplifier l’utilisation de l’IA locale en ajoutant une prise en charge en un clic pour Hermes Agent, OpenClaw et Perplexity Computer. Cette fonctionnalité sera disponible pour les GPU NVIDIA dotés d’au moins 24 Go de mémoire.

Simplification avec Perplexity, Hermes et OpenClaw

Le mois dernier, Perplexity a lancé son agent Portable Computer, permettant une exécution locale simplifiée sur les systèmes Linux comme le DGX Spark. Dès septembre, cet agent sera disponible sur les GPU RTX ayant 24 Go de VRAM ou plus, sous Linux et Windows.

À lire :  Les nouvelles souris de jeu ROG sont conçues pour l'esport mais vos feuilles de calcul vous en seront reconnaissantes aussi

Les utilisateurs pourront exécuter des flux de travail complets localement sans consommer de crédits, tout en ayant la possibilité de déléguer certaines tâches complexes à plus de 15 modèles cloud si nécessaire. L’agent demande toujours une autorisation avant d’envoyer du contenu vers le cloud.

Hermes Agent, développé par Nous Research, est un agent polyvalent utilisé par des millions d’utilisateurs, réputé pour sa fiabilité. Bientôt, sa configuration pour un modèle local sera réduite à un simple clic sur les systèmes RTX et DGX.

L’agent détectera automatiquement le GPU NVIDIA, sélectionnera un modèle et une configuration appropriés, et l’exécutera via une version intégrée de llama.cpp déjà optimisée par NVIDIA. Une fois en route, Hermes utilise des outils, maintient le contexte et améliore ses compétences avec le temps.

OpenClaw est devenu l’un des projets phares du mouvement des agents open-source, avec plus de 380 000 étoiles sur GitHub. NVIDIA, Microsoft et OpenClaw collaborent pour faciliter son installation sur Windows.

L’application Windows d’OpenClaw simplifiera le processus de configuration d’un modèle local optimisé sur toute carte RTX disposant d’au moins 24 Go de mémoire vidéo.

Guide Optimisation Pc Windows 11 Jeux Performance Bot Guide Optimisations Pc Windows 10 Jeux Performances Sur Omgpu.com Bot

Guide Comment Reduire Input Lag Latence Omgpu Bot Comment supprimer Coil Whine carte graphique

Vous pourriez aussi aimer