Meta riposte à la domination de 15 semaines de la Chine sur les tokens IA avec Muse Glimmer, qui tient dans un seul GPU et utilise une technique innovante pour accélérer les réponses

Meta lance Muse Glimmer, un modèle d’IA de 30 milliards de paramètres conçu pour fonctionner entièrement sur une carte graphique grand public. Cette nouvelle approche open-weight mise sur la compression et un assistant prédictif pour offrir des performances rapides sans nécessiter de matériel serveur coûteux.

Un modèle d’IA conçu pour tourner sur un GPU de consommation

Meta revient dans le domaine des modèles d’IA open-weight, une catégorie de grands modèles de langage qu’elle avait elle-même fondée puis délaissée. Ce retour est marqué par le lancement de Muse Glimmer, un modèle de 30 milliards de paramètres qui emploie des techniques astucieuses pour tenir sur un seul GPU grand public tout en répondant aux requêtes avec une rapidité foudroyante.

Muse Glimmer se distingue par deux caractéristiques principales. Premièrement, exécuter un modèle de 30 milliards de paramètres en pleine précision (fp16) nécessite environ 60 Go de mémoire pour les poids. Meta a utilisé la quantification, un procédé de distillation où un gros modèle (Muse Spark) entraîne un plus petit, pour compresser le modèle et réduire les besoins en mémoire des poids à seulement 20 Go. Avec les 2 à 4 Go supplémentaires nécessaires pour le cache KV, une carte graphique grand public de 24 ou 32 Go peut faire tourner Muse Glimmer sans difficulté. Selon Meta, cette compression par distillation n’a aucun impact notable sur les performances.

Deuxièmement, pour accélérer la génération des tokens, Muse Glimmer utilise un petit modèle compagnon appelé DFlash. Ce dernier prédit des blocs de texte entiers, permettant à Muse Glimmer de vérifier la réponse d’un seul coup, en gardant les réponses correctes et en rejetant les erronées. Cette organisation permet d’obtenir des réponses 3,1 fois plus rapides sur une carte RTX 5090, 1,8 fois sur une puce M5 Max et 1,5 fois sur une M4 Max, selon les données fournies par Meta.

À lire :  Intel Arc G3 Extreme testé : Intel est enfin arrivé dans le gaming portable

L’arrivée de Muse Glimmer tombe à point nommé pour le paysage des modèles open-weight occidentaux. Selon les données d’OpenRouter, les IA chinoises ont récemment franchi pour la première fois le seuil des 34 250 milliards de tokens hebdomadaires. DeepSeek V4 Flash a enregistré une croissance ahurissante de 570 % d’une semaine sur l’autre.

D’après le dernier jeu de données d’OpenRouter, l’utilisation mondiale des modèles d’IA a atteint 69 000 milliards de tokens, en hausse de 21,48 % sur une semaine. Les modèles chinois représentaient 34 250 milliards de ce total, tandis que les modèles américains n’en ont contribué que 9 170 milliards. Il s’agit de la quinzième semaine consécutive où les modèles chinois mènent le classement mondial.

Il faudra surveiller les chiffres de la semaine prochaine pour voir si Muse Glimmer de Meta a un impact visible sur l’ascension implacable des modèles d’IA chinois.

Guide Optimisation Pc Windows 11 Jeux Performance Bot Guide Optimisations Pc Windows 10 Jeux Performances Sur Omgpu.com Bot

Guide Comment Reduire Input Lag Latence Omgpu Bot Comment supprimer Coil Whine carte graphique

Vous pourriez aussi aimer