Introduction
Ce journal est dans le prolongement de mes précédents journaux :
- Auto-héberger ses IA : Principes généraux
- Auto-héberger ses IA : Matériel et optimisation de l'inférence
Dans ce journal, on va parler de faire de l'inférence avec des LLM, avec pas ou peu de VRAM. Autrement dit, on va essayer de faire rentrer une grosse pièce carrée dans un petit trou rond.
Comme moi, vous avez peut-être observé quelque chose d'étrange : Il y a plein de vidéos Youtube (…)








