Journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks

20
3
août
2026

Introduction

Ce journal est dans le prolongement de mes précédents journaux :

Dans ce journal, on va parler de faire de l'inférence avec des LLM, avec pas ou peu de VRAM. Autrement dit, on va essayer de faire rentrer une grosse pièce carrée dans un petit trou rond.

Comme moi, vous avez peut-être observé quelque chose d'étrange : Il y a plein de vidéos Youtube (…)

Journal Auto-héberger ses IA : Matériel et optimisation de l'inférence

35
5
juil.
2026

Introduction

Camarades, prolétaires numériques, pingouins, unissez-vous ! Contre la rente des IA propriétaires, armons nos GPU ! Approprions-nous les moyens de production de l'intelligence !

Hem, bref, je pose mon mégaphone, et je rentre dans le vif du sujet.

Ce journal est essentiellement un approfondissement de mon mon précédent journal sur le sujet de l'autohébergement d'IA.

En prérequis, il faut avoir une familiarité avec :

Journal Auto-héberger ses IA

57
18
mai
2026

Introduction

Si on en croit les décideurs pressés sur LinkedIn, l'IA, c'est la nouvelle révolution technologique, la nouvelle ruée vers l'or, et j'en passe. Bientôt, plus besoin d'ingénieurs logiciels !
Et si on en croit mes recommandations Youtube, l'IA, c'est la dernière arnaque à la mode, une bulle économique sans précédent en train de gonfler, et un désastre écologique ¯\(ツ)/¯.
Dans tous les cas, dans les métiers de l'informatique, le sujet est devenu difficile à éviter.

Pour ma (…)