Le nouveau modèle d’IA de Meta fonctionne entièrement hors ligne, mais votre GPU doit suivre le rythme

Meta a lancé un nouveau modèle d’IA, et pour une fois, le plus gros titre ne concerne pas ses capacités, mais sa liberté. Muse Glimmer, fort d’environ 30 milliards de paramètres, est publié sous licence Apache 2.0. Cela signifie que les poids du modèle sur Hugging Face sont téléchargeables, modifiables et utilisables sans autorisation préalable. Vous pouvez l’exécuter directement sur une carte graphique de votre machine locale, sans ferme de serveurs ni connexion en ligne.

Présentation de Muse Glimmer : un modèle d’IA ouvert et compressé

Le laboratoire Superintelligence de Meta a pris son modèle plus grand, Muse Spark, et lui a essentiellement fait enseigner à une version plus petite et plus légère comment penser comme lui. Muse Glimmer accepte les entrées de texte et d’image, mais ne répond qu’en texte. Il prend en charge plus de 100 langues, se souvient des conversations s’étendant sur plus de 131 000 tokens, et ses connaissances s’arrêtent au 4 janvier 2026.

De quelle quantité de RAM avez-vous besoin ?

En pleine précision, Muse Glimmer nécessiterait 64 Go de mémoire vidéo, bien plus que ce que la plupart des gens possèdent, surtout à l’ère des prix gonflés de la RAM pour l’IA. Meta contourne ce problème avec la quantification, une méthode qui compresse les nombres utilisés par le modèle afin qu’il prenne beaucoup moins de place. Cela réduit la partie linguistique à moins de 20 Go.

Muse Glimmer sur Hugging Face

Deux versions sont disponibles. La version K-Quant-Dynamic nécessite 32 Go et ne perd quasiment aucune précision (0,2 %), tandis que la version K-Quant-17Go se contente de 24 Go avec une perte de précision légèrement plus élevée, de 1 %. En pratique, cela signifie que vous avez besoin d’au moins une RTX 5090, une RTX 4090, une RTX 3090, ou un Mac avec une puce Apple Silicon Max.

À lire :  ProbablyMonsters mise sur les boucles de rejeu à 19.99€ avec Crimson Moon, un RPG d'action/aventure gothique basé sur des incursions courtes

Est-ce vraiment rapide ?

Meta a associé le modèle à un accélérateur appelé DFlash qui prédit plusieurs tokens à la fois au lieu d’un seul. Sur une RTX 5090, cela fait passer la vitesse de 74,9 tokens par seconde à 233,4, soit plus de trois fois plus rapide.

Augmentation de vitesse D-flash de Muse Glimmer

Comparé au Gemma4 de Google et au Qwen3.6 d’Alibaba, Muse Glimmer est en tête pour la planification et les tâches en plusieurs étapes, mais il est à la traîne pour ce qui est de l’utilisation concrète d’un bureau. Vous pouvez le récupérer dès maintenant via Hugging Face ou LM Studio si vous disposez du matériel compatible.

Guide Optimisation Pc Windows 11 Jeux Performance Bot Guide Optimisations Pc Windows 10 Jeux Performances Sur Omgpu.com Bot

Guide Comment Reduire Input Lag Latence Omgpu Bot Comment supprimer Coil Whine carte graphique

Vous pourriez aussi aimer