Un utilisateur cherche à pousser les limites de l’IA locale avec du matériel intensif. Malgré des spécifications solides, l’expérience a tourné court avec la défaillance prématurée de composants mémoire, révélant les contraintes d’une utilisation prolongée sous haute charge.
Quand l’IA locale malmène le matériel
Exécuter un modèle d’IA de 20 milliards de paramètres sur une RTX 5070 Ti dotée de 16 Go de VRAM GDDR7 ne posait aucun problème. Mais pour des tâches plus complexes, un utilisateur a estimé ce modèle trop limitant pour son flux de travail quotidien. Il a donc décidé de passer à une version plus dense de 35 milliards de paramètres. Pour compléter la mémoire du GPU, il a utilisé 128 Go de RAM DDR4 ECC issue d’un poste de travail. Le résultat fut surprenant : après seulement 90 minutes d’exécution, l’un des modules DDR4 est tombé en panne, l’utilisateur affirmant que la température n’était pas en cause.
Avant de lancer le modèle Ornith-1.5-35B-A3B, cet utilisateur pouvait facilement héberger un LLM de 20B dans la mémoire vidéo de sa carte graphique. Mais pour ses travaux sur des bases de données complexes, opter pour un modèle plus dense était la seule solution. Après avoir configuré son système avec les 128 Go de RAM, il a démarré l’exécution du modèle 35B. À son retour une heure et demie plus tard, le système avait planté.
L’enquête a révélé qu’un des modules de 8 Go DDR4 était défectueux. Après l’avoir retiré, l’utilisateur a relancé le modèle. Il explique avoir choisi ce dernier pour la qualité de ses résultats et parce que les performances par token ne se dégradaient pas une fois que la VRAM de la RTX 5070 Ti était saturée et que la mémoire système prenait le relais. Il pensait initialement à un simple défaut de fabrication, un problème relativement fréquent.
Cependant, après avoir fait tourner le modèle durant 8 à 9 jours, la consultation des journaux d’erreur a indiqué qu’un second module était sur le point de lâcher. Cette séquence suggère que l’utilisation de vieille mémoire DDR4 n’est pas idéale pour une charge de travail aussi exigeante. Si l’utilisateur assure que la température n’était pas problématique, il ne mentionne que celles du CPU et du GPU, qui n’ont jamais dépassé 80°C. Outre leur âge, les modules mémoire grand public ne sont pas conçus pour supporter des lectures séquentielles continues sur de longues périodes.
On pourrait tenter l’expérience avec de la DDR5, qui présente une meilleure tolérance en température et en lectures, mais notre intuition est que les températures élevées ont eu raison du premier module DDR4 ECC et ont rapidement dégradé le second. Si ce n’était pas le cas, pourquoi l’utilisateur n’a-t-il fourni aucune lecture de température de la RAM ? L’âge des composants, un stress prolongé et un refroidissement peut-être insuffisant sont les coupables probables de ces pannes, mais sans toutes les données, le mystère reste entier.



