Désolé pour le délai, j'ai consacré mon temps à trouver et acquérir d'occasion les composants nécessaires pour faire tourner "efficacement" le nouveau Qwen 3.8 27B.
Mon portefeuille et ma patience en ont pris un sacré coup et ça a duré des jours, j'ai fini par craquer et acheter une 3080Ti FE au dessus du prix que je m'étais fixé ; mais j'en ai fini, si tout va bien à réception.
Je vais retrouver dans le fil le détail de ce que je t'ai proposé, le zipper et passer le lien dans le courant de la semaine prochaine.
Parce que c'est bien moins cher ! Je ne suis pas un fétichiste du vieux matos.
J'imaginais un plus gros delta de consommation, ça me conforte.
J'ai décroché sur le prix du hardware il y a un bail, mais quand j'ai voulu explorer les IAs et que j'ai vu les tarifs tant en neuf qu'en occasion du matériel adapté, je suis tombé de ma chaise, et ça ne s'est pas arrangé depuis.
Donc si je vise un setup directement performant mais upgradable par ajout, il ne restait pas beaucoup d'options.
Je m'en suis tiré pour 240 (MB+proc) + 180 (RAM) + 45 (ventirad) + 100 (alim 1200W).
Avec ça je double ma vitesse de génération avec mes modèles et ma carte graphique actuelle (Titan Xp), et je peux y placer 3x 3060 12Go en PCIE3 16x as-is, ou autre chose.
Je reste en veille pour voir ce qui se présente avec un bon rapport qualité/prix.
Je dois bien avouer que j'ai utilisé Claude pour les évaluations de gains potentiels. Il connait mon setup, ses performances qui sont documentées dans ses fichiers de projet, les modèles et les apps que j'utilise, et il est idéal pour estimer assez précisément l'avant/après, et trouver les plateformes exotiques quivontbien en évitant les pièges liées à des limitations de chipset, de bios, de gestion mémoire, de mémoire supportée, de connectique, etc…
Il faut souvent lui tirer les vers du nez, mais c'est incomparablement plus rapide que de tout rassembler soi-même, et comme les prix augmentent sans arrêt, y compris en occasion ; le temps c'est vraiment de l'argent.
Je suis moi même en train d'essayer de me monter une machine me permettant de faire tourner des plus gros modèles, et mes modèles actuels plus vite.
Si on laisse de côté la carte graphique, qui est devenue plus rare et chère qu'une licorne, le levier côté RAM se situe au niveau de la bande passante.
Pour ma part, je remplace mon i7-7700k sur chipset h270 (dual channel DDR4 2133MHz) par un threadripper 1950x sur chipset x399.
J'y perds de la consommation électrique en idle (les remarques assassines vont fuser), mais j'y gagne un quasi doublement de la bande passante, (DDR4 2666MHz dual rank quad channel), la possibilité d'installer 3 cartes graphiques sur 16 lignes PCIE3 chacune, au lieu d'un 16+4 sur ma carte mère actuelle, et des performances brutes en multi thread bien meilleures.
Grosso modo un petit cran en dessous de la bande passante d'une plateforme DDR5 entrée de gamme en dual channel, pour une fraction du prix.
Il est encore possible de trouver de bonnes affaires sur des composants un peu exotiques et anciens de ce type, qui ont des specs adaptées à l'inférence tout en restant accessibles sur le marché de l'occasion.
Et si j'ai tout bien compris, en simplifiant et toutes choses étant égales par ailleurs, 2x plus de bande passante mémoire = 2x plus de tokens/s si le calcul suit, en RAM comme en VRAM ; et si ton modèle est en RAM, la vitesse de prefill augmentera aussi.
J'espère que tu voudras bien m'excuser d'avoir répondu positivement à la question posée par un autre que toi, la prochaine fois je l'enverrai promener, faute d'avoir obtenu ton Auguste approbation.
Pardonne moi également de faire exactement ce que tu réprouves, c'est à dire utiliser un outil performant et adapté à mes besoins, qui ont apparemment l'inexcusable défaut d'être différents des tiens.
J'espère que tu pardonneras également Walter d'avoir fait preuve de curiosité envers quelque chose que tu juges indigne d'intérêt, avec une peu de chance il aura compris la leçon, et à l'avenir il sollicitera ton approbation préalable.
Maintenant, c'est l'heure de su-sucre, la récompense pour une belle pirouette.
Savoir que tu ne trouves pas cela utilisable m'en touche une sans me bouger l'autre, vu que moi je l'utilise et j'en suis satisfait.
Puisque tu critiques pour prouver au monde que tu existes, tu pourrais au moins prendre la peine de lire ce que tu critiques, cela rendrait ton intervention (un peu) légitime.
AoC ce n'est pas avec 1000 milliards de paramètres que cela a été fait, mais avec 3 milliards de paramètres actifs et 35 milliards de paramètres totaux, et le seul prompt était le mien vu que le modèle est hébergé en local sur mon PC.
Mais comme tu es là pour faire ton intéressant et pour avoir le dernier mot, tu vas maintenant trouver le moyen d'affirmer que le nombre de paramètres et le prompt du fournisseur sont sans importances, alors que c'était précisément l'objet de ta remarque. Il te reste le nombre aléatoire, tu peux toujours t'y accrocher ; mais sa nature aléatoire le rend versatile.
Vas-y, montre au monde entier à quelle point tu maîtrises l'art de la pirouette, il n'attendait que ça.
J'ai tout gardé, mais c'est bien le bordel. En plus je faisait ça souvent jusque tard dans la nuit, et j'ai souvent fini épuisé.
Je dois pouvoir te fournir le dossier dans lequel il a produit tout le code pour AoC2025 en python, un level demo simplifié type Mario en html (j'en avais un en python, mais je ne le trouve plus), une calculatrice html simple.
Je ne retrouve pas le tetris avec lequel j'avais validé la vision mais si tu le veux vraiment, je peux explorer les snapshots.
J'ai aussi les dossiers qui contiennent le code de mon agent, mais là c'est Claude qui l'a fait, puis mon agent qui l'a refactoré pour utilisation sur une autre machine avec des conventions strictes.
Dis moi comment te passer tout ça.
Par contre je ne suis pas compétent pour commenter ou expliquer quoi que ce soit dans le code.
RX6700 12Gb ou RX6800 16Gb, mais tu vas perdre en vitesse de prefill par rapport à une 3060 sous Cuda. Seule une RX 7800 XT 16 Go fait jeu égal en prefill avec Rocm.
Si le contexte de tes cas d'usage reste modéré, ça ne sera pas trop pénalisant. D'autant qu'AMD met le paquet sur Rocm pour ne pas complètement rater le train de l'IA, et se retrouver coincé sur le marché misérable des Gamers, alors l'espoir est permis s'il y arrivent avant que ta carte passe en legacy.
Si tu est rebuté par la complexité de la configuration du setup, économise 100€ sur la carte et offre toi un mois de Claude Max. Il peut le faire à ta place sous ta supervision ou t'expliquer ce qu'il faut faire et te laisser mettre les mains dans le cambouis, et te faire une doc et un runbook pour l'exploitation et les mises à jour.
Tuteur ou Assistant.
En mettant opus4.8 au travail, opus4.6 à la doc et la sélection auto pour claude code, tu économises les tokens pour rester dans le forfait et il a un niveau époustouflant sur le sujet de l'inférence locale.
De problème de quoi ?
De choix de la mauvaise mutuelle ?
Il a présenté une analyse argumentée, avec des sources pour les textes légaux, des références aux documents qu'on lui a donné, des explications détaillées de ses préconisations.
Un rapport complet et circonstancié.
Vérifier ? Tout est dans les sources. Les documents sont ceux qu'on lui a fourni et les liens sont cliquables.
Une question, une précision ?
Il n'y a qu'à demander.
Je ne sais pas ce qu'il te faut de plus à part quelqu'un à qui reprocher quelque chose.
Ce qu'il serait intéressant de savoir, c'est comment as-tu prompté Gemini ?
Je me suis rapidement rendu compte des défauts de Claude par exemple, et j'ai placé un prompt général avec des consignes pour y remédier, et maintenant les recherches internet sont fiables, mais elles consomment un max de tokens.
C'est pareil pour les analyses multi sources.
Au boulot j'ai mis Claude au service des RHs, pour déterminer quelle serait la meilleure offre de mutuelle.
On lui a fourni tous les documents dont la personne en charge se servait, en ayant pris soin d'en supprimer toute référence aux personnes, fichiers excels, pdf des différentes offres, du contrat actuel, etc.
Il a eu droit à un prompt projet, qui lui donnait les infos sur la boîte : droit local Alsacien, filiale d'un groupe, CA, masse salariale, convention collective, etc.
Il a sorti une analyse complète et motivée en 20 minutes, tenant compte du droit local, de toutes les infos comptables pertinentes, de la pyramide des âges du personnel, de la convention collective et de toutes les contraintes et consignes qu'on lui a imposées, en allant même au delà.
2 semaines d'un boulot déplaisant et fastidieux (du point de vue de celle qui devait se le coltiner). Le forfait mensuel est largement amorti pour ce mois-çi.
Mon setup ne supporterait pas une 3060 de plus. 750W 80+ silver et la titanXp consomme déjà 250W.
En plus je serai obligé de la brider avec Cuda 12 si j'ai bien compris, parce que la titanXp est dépréciée et ne supporte pas Cuda 13.
Je pourrai toujours brider les tdp, mais je suis plutôt satisfait de la version de Qwen/Ornith que j'utilise.
La profondeur de raisonnement et les compétences en codage et sysadmin me permettent de faire des choses inespérées.
Pour l'instant je l'ai scaffoldé pour du python, pour le tester il a résolu AoC 2025, m'a fait un démo level type super mario fonctionnel et un tetris à partir d'un layout PNG (mmproj).
Une fois au point, je l'ai mis au travail sur le frontend d'inférence pour qu'il refactore une copie de lui-même dont le code est validé pydantic et vérifié ruff avec des conventions de nommage et placement strictes.
Ca me semblait ambitieux pour un A3B scaffoldé par un newbie, alors je me suis morigéné pour ne rien espérer, mais il a réussi.
Pour moi sa principale limite est dans le contexte réellement utile. Au delà de 40k il se perd en temps qu'orchestrateur, même si en tant qu'agent il semble pouvoir en gérer plus ; mais le prefill devient le problème de toutes façons.
C'est en partie pour ça que les sessions de mon agent sont limitées à 20min, s'il les atteint c'est le fallback avec synthèse par llm (toujours le même pour éviter le swap) qui est renvoyé en retour d'outil au modèle du chat et qui remplace son rapport.
J'ai lu ton précédent journal, et j'y ai appris l'existence de Qwen 3.6 MTP… C'est le prochain que je teste.
S'il est aussi bon que celui que j'ai tout en étant plus rapide, c'est vraiment super !
Je pense que ton objectif est atteignable avec une simple 3060 12Gb d'occas à 200€ sur lbc si tu fais un bon achat.
Tu peux faire tourner qwen3.6 35B/A3B Q4_k en mode thinking avec une fenêtre de contexte de 65k sans problème, avec un petit modèle chargé en même temps pour le speech-to-text
En séparant le chat vocal de l'exécution, au prix d'une latence de quelques secondes entre les 2, tu peux fortement économiser le contexte du chatteur par rapport aux outils et à leur utilisation, vu que tu ne lui en présentes qu'un seul : son agent, qui est stateless.
Si tu peux (je ne connais pas le domaine), utilise l'agent pour passer des commandes CLI, avec une documentation bien structurée sous forme de fichier markdown à sa disposition pour connaître l'architecture et les commandes de ton installation domotique.
Le CLI il connaît par coeur, les outils pour lire ou filtrer un fichier aussi.
Même s'il ne connaît pas les commandes domotiques spécifiques, ce sera la seule partie "difficile" de son travail, et si la doc est bien faite (de son point de vue), il y arrivera sans peine au coup par coup (stateless).
Si tu veux échanger sur le sujet avec un débutant qui essaye de progresser, ce serait avec plaisir.
j'ai lu tout le journal, et maintenant je suis obligé de lire les précédents…
Tes chiffres confirment ce que Claude avait fini par conclure quand j'ai envisagé d'acheter une RTX 3060 d'occasion.
Pour faire court : Ma config est limitée par la quantité de VRAM et la bande passante de la RAM. Une 3060 n'y changera presque rien, à part peut être une occupation VRAM légèrement inférieure à cause de certaines instructions inexistantes sur les GPU de génération Pascal.
J'ai un i7-7700k 32Go/2400 et une Titan Xp Pascal 12GB ~540GB/s
J'ai fait faire des tests à mon Qwen3.6 35B A3B_Q4K en mode agent, avec les même valeurs de contexte (hors scaffolding ~2450tk), et j'obtiens les résultats suivants :
Palier visé │ Tok utiles │ Prefill tok/s │ Prédiction tok/s │ Tok générés
1 000 │ 1 084 │ 352.6 │ 22.3 │ 227
2 000 │ 2 161 │ 367.9 │ 23.1 │ 256
4 000 │ 4 334 │ 383.7 │ 23.0 │ 161
8 000 │ 8 659 │ 373.3 │ 21.9 │ 204
16 000 │ 17 375 │ 358.8 │ 21.7 │ 256
32 000 │ 34 810 │ 320.2 │ 21.2 │ 171
Je me permet de faire une suggestion.
J'ai découvert récemment que la vitesse de prefill pouvait être améliorée en jouant sur un paramètre. J'ai obtenu ces résultats avec la valeur modifiée, qui a tout changé au prix d'une légère augmentation de l'occupation VRAM :
--ubatch-size, passé de 512 (défaut) à 1536. Gain mesuré : +91% sur le prefill de Qwen3.6, un peu moins pour Gemma 4 26B A4B.
Tu l'as sûrement déjà fait au vu de tes résultats, mais comme tu n'en fais pas mention j'ai jugé utile de le mentionner.
Sur ce sujet précis, je n'ai pas hésité longtemps.
J'ai choisi celui qui était présenté comme le meilleur pouvant tourner sur mon setup.
Qwen 3.6 35B A3B Q4_XL et par la suite sa déclinaison ornith.
J'ai aussi testé Gemma 4 26B A4B, mais il a un bug de template que je dois mettre à jour, et il est plus efficace comme orchestrateur dans le chat que comme agent.
Contrairement à Qwen, il n'a pas deux modes de fonctionnement différents chat/agent qui le poussent à proposer quelque chose puis à faire autre chose.
Il dit ce qu'il va faire et il fait ce qu'il a dit, il est aussi plus docile vis à vis de son system prompt.
J'ai essayé playwright, mais inutilisable par un petit modèle.
Je ne sais pas si c'est vraiment un MCP, mais j'utilise context7.
C'est super pratique pour récupérer de l'info filtrée sur les API d'apps qui ne sont pas sur la machine ni la distribution du modèle et qu'il ne peut pas interroger en local, en plus c'est in-distribution, qwen sait s'en servir sans problème.
Par contre il ne le fait pas spontanément :(
Des étapes il y en a eu. Ca fait 3 mois que je suis dessus et il y a eu moults tentatives qui ont échoué.
J'ai testé Goose, Opencode et littlecoder avant de me fixer sur un harness custom basé sur le framework qwenagent et à chaque fois je pensais que c'était le bon.
Les seules questions sont passives/agressives et principalement rhétoriques, je vais quand même y répondre.
Utiliser Claude pour configurer une Debian ?
-Oui, c’est cela. Tu as bien compris cette partie.
Et au final, est ce que tu saurais reproduire la config par toi même, et la dépanner si il y a un problème ?
-Non, je ne saurais pas, de toute évidence.
Mais cela ne me pose pas de problème, car qwen 3.6 35B A3B MoE Q4k, lui il saura ; et ça tombe bien parce qu’il est à ma disposition H24, et que la facture qu’il me présente se limite à celle de l’électricité que son infra consomme, càd peu ou prou celle d’un PC de jeu.
D’ailleurs c’est ce qu’il est en train de faire, non sans difficultés ; mais avec un certain succès, comme je l’ai d’ailleurs écrit dans le journal.
Claude était nécessaire pour le montage, mais pour l’exploitation je me passe de lui (pour l’instant), et c'était bien le but, même si l'abonnement Claude n'est désormais plus à ma charge.
Je comprends tout à fait que certains n’adhèrent pas à cette démarche, nous avons tous nos idiosyncrasies ; moi le premier.
[^] # Re: Code
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -3 (+0/-0).
Wesendit, je préfère.
Désolé pour le délai, j'ai consacré mon temps à trouver et acquérir d'occasion les composants nécessaires pour faire tourner "efficacement" le nouveau Qwen 3.8 27B.
Mon portefeuille et ma patience en ont pris un sacré coup et ça a duré des jours, j'ai fini par craquer et acheter une 3080Ti FE au dessus du prix que je m'étais fixé ; mais j'en ai fini, si tout va bien à réception.
Je vais retrouver dans le fil le détail de ce que je t'ai proposé, le zipper et passer le lien dans le courant de la semaine prochaine.
[^] # Re: Passer de 16 à 32 Go : un vrai gain, mais jusqu’où ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 0 (+1/-1).
Parce que c'est bien moins cher ! Je ne suis pas un fétichiste du vieux matos.
J'imaginais un plus gros delta de consommation, ça me conforte.
J'ai décroché sur le prix du hardware il y a un bail, mais quand j'ai voulu explorer les IAs et que j'ai vu les tarifs tant en neuf qu'en occasion du matériel adapté, je suis tombé de ma chaise, et ça ne s'est pas arrangé depuis.
Donc si je vise un setup directement performant mais upgradable par ajout, il ne restait pas beaucoup d'options.
Je m'en suis tiré pour 240 (MB+proc) + 180 (RAM) + 45 (ventirad) + 100 (alim 1200W).
Avec ça je double ma vitesse de génération avec mes modèles et ma carte graphique actuelle (Titan Xp), et je peux y placer 3x 3060 12Go en PCIE3 16x as-is, ou autre chose.
Je reste en veille pour voir ce qui se présente avec un bon rapport qualité/prix.
Je dois bien avouer que j'ai utilisé Claude pour les évaluations de gains potentiels. Il connait mon setup, ses performances qui sont documentées dans ses fichiers de projet, les modèles et les apps que j'utilise, et il est idéal pour estimer assez précisément l'avant/après, et trouver les plateformes exotiques quivontbien en évitant les pièges liées à des limitations de chipset, de bios, de gestion mémoire, de mémoire supportée, de connectique, etc…
Il faut souvent lui tirer les vers du nez, mais c'est incomparablement plus rapide que de tout rassembler soi-même, et comme les prix augmentent sans arrêt, y compris en occasion ; le temps c'est vraiment de l'argent.
[^] # Re: Passer de 16 à 32 Go : un vrai gain, mais jusqu’où ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 0 (+0/-0).
Je suis moi même en train d'essayer de me monter une machine me permettant de faire tourner des plus gros modèles, et mes modèles actuels plus vite.
Si on laisse de côté la carte graphique, qui est devenue plus rare et chère qu'une licorne, le levier côté RAM se situe au niveau de la bande passante.
Pour ma part, je remplace mon i7-7700k sur chipset h270 (dual channel DDR4 2133MHz) par un threadripper 1950x sur chipset x399.
J'y perds de la consommation électrique en idle (les remarques assassines vont fuser), mais j'y gagne un quasi doublement de la bande passante, (DDR4 2666MHz dual rank quad channel), la possibilité d'installer 3 cartes graphiques sur 16 lignes PCIE3 chacune, au lieu d'un 16+4 sur ma carte mère actuelle, et des performances brutes en multi thread bien meilleures.
Grosso modo un petit cran en dessous de la bande passante d'une plateforme DDR5 entrée de gamme en dual channel, pour une fraction du prix.
Il est encore possible de trouver de bonnes affaires sur des composants un peu exotiques et anciens de ce type, qui ont des specs adaptées à l'inférence tout en restant accessibles sur le marché de l'occasion.
Et si j'ai tout bien compris, en simplifiant et toutes choses étant égales par ailleurs, 2x plus de bande passante mémoire = 2x plus de tokens/s si le calcul suit, en RAM comme en VRAM ; et si ton modèle est en RAM, la vitesse de prefill augmentera aussi.
[^] # Re: Code
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -4 (+2/-5). Dernière modification le 05 août 2026 à 11:32.
J'espère que tu voudras bien m'excuser d'avoir répondu positivement à la question posée par un autre que toi, la prochaine fois je l'enverrai promener, faute d'avoir obtenu ton Auguste approbation.
Pardonne moi également de faire exactement ce que tu réprouves, c'est à dire utiliser un outil performant et adapté à mes besoins, qui ont apparemment l'inexcusable défaut d'être différents des tiens.
J'espère que tu pardonneras également Walter d'avoir fait preuve de curiosité envers quelque chose que tu juges indigne d'intérêt, avec une peu de chance il aura compris la leçon, et à l'avenir il sollicitera ton approbation préalable.
Maintenant, c'est l'heure de su-sucre, la récompense pour une belle pirouette.
[^] # Re: Code
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -6 (+3/-6). Dernière modification le 05 août 2026 à 00:33.
Savoir que tu ne trouves pas cela utilisable m'en touche une sans me bouger l'autre, vu que moi je l'utilise et j'en suis satisfait.
Puisque tu critiques pour prouver au monde que tu existes, tu pourrais au moins prendre la peine de lire ce que tu critiques, cela rendrait ton intervention (un peu) légitime.
AoC ce n'est pas avec 1000 milliards de paramètres que cela a été fait, mais avec 3 milliards de paramètres actifs et 35 milliards de paramètres totaux, et le seul prompt était le mien vu que le modèle est hébergé en local sur mon PC.
Mais comme tu es là pour faire ton intéressant et pour avoir le dernier mot, tu vas maintenant trouver le moyen d'affirmer que le nombre de paramètres et le prompt du fournisseur sont sans importances, alors que c'était précisément l'objet de ta remarque. Il te reste le nombre aléatoire, tu peux toujours t'y accrocher ; mais sa nature aléatoire le rend versatile.
Vas-y, montre au monde entier à quelle point tu maîtrises l'art de la pirouette, il n'attendait que ça.
[^] # Re: Code
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -5 (+2/-4).
Merci pour ton avis tout à fait pertinent concernant ma réponse à la question d'un autre.
Je me sens beaucoup plus éclairé à présent, je vais tout laisser tomber et aller élever des chèvres car tu m'as ouvert les yeux, merci à toi.
[^] # Re: Code
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -3 (+3/-3).
J'ai tout gardé, mais c'est bien le bordel. En plus je faisait ça souvent jusque tard dans la nuit, et j'ai souvent fini épuisé.
Je dois pouvoir te fournir le dossier dans lequel il a produit tout le code pour AoC2025 en python, un level demo simplifié type Mario en html (j'en avais un en python, mais je ne le trouve plus), une calculatrice html simple.
Je ne retrouve pas le tetris avec lequel j'avais validé la vision mais si tu le veux vraiment, je peux explorer les snapshots.
J'ai aussi les dossiers qui contiennent le code de mon agent, mais là c'est Claude qui l'a fait, puis mon agent qui l'a refactoré pour utilisation sur une autre machine avec des conventions strictes.
Dis moi comment te passer tout ça.
Par contre je ne suis pas compétent pour commenter ou expliquer quoi que ce soit dans le code.
[^] # Re: Ça vous sert à quoi au quotidien ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à -3 (+1/-1).
Les informations sont de Fable.
RX6700 12Gb ou RX6800 16Gb, mais tu vas perdre en vitesse de prefill par rapport à une 3060 sous Cuda. Seule une RX 7800 XT 16 Go fait jeu égal en prefill avec Rocm.
Si le contexte de tes cas d'usage reste modéré, ça ne sera pas trop pénalisant. D'autant qu'AMD met le paquet sur Rocm pour ne pas complètement rater le train de l'IA, et se retrouver coincé sur le marché misérable des Gamers, alors l'espoir est permis s'il y arrivent avant que ta carte passe en legacy.
Si tu est rebuté par la complexité de la configuration du setup, économise 100€ sur la carte et offre toi un mois de Claude Max. Il peut le faire à ta place sous ta supervision ou t'expliquer ce qu'il faut faire et te laisser mettre les mains dans le cambouis, et te faire une doc et un runbook pour l'exploitation et les mises à jour.
Tuteur ou Assistant.
En mettant opus4.8 au travail, opus4.6 à la doc et la sélection auto pour claude code, tu économises les tokens pour rester dans le forfait et il a un niveau époustouflant sur le sujet de l'inférence locale.
Je n'ai pas d'actions chez Anthropic.
[^] # Re: Ça vous sert à quoi au quotidien ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 0 (+3/-3). Dernière modification le 04 août 2026 à 00:37.
De problème de quoi ?
De choix de la mauvaise mutuelle ?
Il a présenté une analyse argumentée, avec des sources pour les textes légaux, des références aux documents qu'on lui a donné, des explications détaillées de ses préconisations.
Un rapport complet et circonstancié.
Vérifier ? Tout est dans les sources. Les documents sont ceux qu'on lui a fourni et les liens sont cliquables.
Une question, une précision ?
Il n'y a qu'à demander.
Je ne sais pas ce qu'il te faut de plus à part quelqu'un à qui reprocher quelque chose.
[^] # Re: Ça vous sert à quoi au quotidien ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 2 (+4/-2).
Ce qu'il serait intéressant de savoir, c'est comment as-tu prompté Gemini ?
Je me suis rapidement rendu compte des défauts de Claude par exemple, et j'ai placé un prompt général avec des consignes pour y remédier, et maintenant les recherches internet sont fiables, mais elles consomment un max de tokens.
C'est pareil pour les analyses multi sources.
Au boulot j'ai mis Claude au service des RHs, pour déterminer quelle serait la meilleure offre de mutuelle.
On lui a fourni tous les documents dont la personne en charge se servait, en ayant pris soin d'en supprimer toute référence aux personnes, fichiers excels, pdf des différentes offres, du contrat actuel, etc.
Il a eu droit à un prompt projet, qui lui donnait les infos sur la boîte : droit local Alsacien, filiale d'un groupe, CA, masse salariale, convention collective, etc.
Il a sorti une analyse complète et motivée en 20 minutes, tenant compte du droit local, de toutes les infos comptables pertinentes, de la pyramide des âges du personnel, de la convention collective et de toutes les contraintes et consignes qu'on lui a imposées, en allant même au delà.
2 semaines d'un boulot déplaisant et fastidieux (du point de vue de celle qui devait se le coltiner). Le forfait mensuel est largement amorti pour ce mois-çi.
[^] # Re: très éclairant
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 2 (+2/-0).
Mon setup ne supporterait pas une 3060 de plus. 750W 80+ silver et la titanXp consomme déjà 250W.
En plus je serai obligé de la brider avec Cuda 12 si j'ai bien compris, parce que la titanXp est dépréciée et ne supporte pas Cuda 13.
Je pourrai toujours brider les tdp, mais je suis plutôt satisfait de la version de Qwen/Ornith que j'utilise.
La profondeur de raisonnement et les compétences en codage et sysadmin me permettent de faire des choses inespérées.
Pour l'instant je l'ai scaffoldé pour du python, pour le tester il a résolu AoC 2025, m'a fait un démo level type super mario fonctionnel et un tetris à partir d'un layout PNG (mmproj).
Une fois au point, je l'ai mis au travail sur le frontend d'inférence pour qu'il refactore une copie de lui-même dont le code est validé pydantic et vérifié ruff avec des conventions de nommage et placement strictes.
Ca me semblait ambitieux pour un A3B scaffoldé par un newbie, alors je me suis morigéné pour ne rien espérer, mais il a réussi.
Pour moi sa principale limite est dans le contexte réellement utile. Au delà de 40k il se perd en temps qu'orchestrateur, même si en tant qu'agent il semble pouvoir en gérer plus ; mais le prefill devient le problème de toutes façons.
C'est en partie pour ça que les sessions de mon agent sont limitées à 20min, s'il les atteint c'est le fallback avec synthèse par llm (toujours le même pour éviter le swap) qui est renvoyé en retour d'outil au modèle du chat et qui remplace son rapport.
J'ai lu ton précédent journal, et j'y ai appris l'existence de Qwen 3.6 MTP… C'est le prochain que je teste.
S'il est aussi bon que celui que j'ai tout en étant plus rapide, c'est vraiment super !
[^] # Re: Ça vous sert à quoi au quotidien ?
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 3 (+3/-0).
Je pense que ton objectif est atteignable avec une simple 3060 12Gb d'occas à 200€ sur lbc si tu fais un bon achat.
Tu peux faire tourner qwen3.6 35B/A3B Q4_k en mode thinking avec une fenêtre de contexte de 65k sans problème, avec un petit modèle chargé en même temps pour le speech-to-text
En séparant le chat vocal de l'exécution, au prix d'une latence de quelques secondes entre les 2, tu peux fortement économiser le contexte du chatteur par rapport aux outils et à leur utilisation, vu que tu ne lui en présentes qu'un seul : son agent, qui est stateless.
Si tu peux (je ne connais pas le domaine), utilise l'agent pour passer des commandes CLI, avec une documentation bien structurée sous forme de fichier markdown à sa disposition pour connaître l'architecture et les commandes de ton installation domotique.
Le CLI il connaît par coeur, les outils pour lire ou filtrer un fichier aussi.
Même s'il ne connaît pas les commandes domotiques spécifiques, ce sera la seule partie "difficile" de son travail, et si la doc est bien faite (de son point de vue), il y arrivera sans peine au coup par coup (stateless).
Si tu veux échanger sur le sujet avec un débutant qui essaye de progresser, ce serait avec plaisir.
# très éclairant
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 3 (+4/-1).
j'ai lu tout le journal, et maintenant je suis obligé de lire les précédents…
Tes chiffres confirment ce que Claude avait fini par conclure quand j'ai envisagé d'acheter une RTX 3060 d'occasion.
Pour faire court : Ma config est limitée par la quantité de VRAM et la bande passante de la RAM. Une 3060 n'y changera presque rien, à part peut être une occupation VRAM légèrement inférieure à cause de certaines instructions inexistantes sur les GPU de génération Pascal.
J'ai un i7-7700k 32Go/2400 et une Titan Xp Pascal 12GB ~540GB/s
J'ai fait faire des tests à mon Qwen3.6 35B A3B_Q4K en mode agent, avec les même valeurs de contexte (hors scaffolding ~2450tk), et j'obtiens les résultats suivants :
Palier visé │ Tok utiles │ Prefill tok/s │ Prédiction tok/s │ Tok générés
1 000 │ 1 084 │ 352.6 │ 22.3 │ 227
2 000 │ 2 161 │ 367.9 │ 23.1 │ 256
4 000 │ 4 334 │ 383.7 │ 23.0 │ 161
8 000 │ 8 659 │ 373.3 │ 21.9 │ 204
16 000 │ 17 375 │ 358.8 │ 21.7 │ 256
32 000 │ 34 810 │ 320.2 │ 21.2 │ 171
Je me permet de faire une suggestion.
J'ai découvert récemment que la vitesse de prefill pouvait être améliorée en jouant sur un paramètre. J'ai obtenu ces résultats avec la valeur modifiée, qui a tout changé au prix d'une légère augmentation de l'occupation VRAM :
--ubatch-size, passé de 512 (défaut) à 1536. Gain mesuré : +91% sur le prefill de Qwen3.6, un peu moins pour Gemma 4 26B A4B.
Tu l'as sûrement déjà fait au vu de tes résultats, mais comme tu n'en fais pas mention j'ai jugé utile de le mentionner.
[^] # Re: Vexant
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à 1 (+2/-1). Dernière modification le 03 août 2026 à 18:34.
Sur ce sujet précis, je n'ai pas hésité longtemps.
J'ai choisi celui qui était présenté comme le meilleur pouvant tourner sur mon setup.
Qwen 3.6 35B A3B Q4_XL et par la suite sa déclinaison ornith.
J'ai aussi testé Gemma 4 26B A4B, mais il a un bug de template que je dois mettre à jour, et il est plus efficace comme orchestrateur dans le chat que comme agent.
Contrairement à Qwen, il n'a pas deux modes de fonctionnement différents chat/agent qui le poussent à proposer quelque chose puis à faire autre chose.
Il dit ce qu'il va faire et il fait ce qu'il a dit, il est aussi plus docile vis à vis de son system prompt.
[^] # Re: Vexant
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à -1 (+1/-2).
J'ai essayé playwright, mais inutilisable par un petit modèle.
Je ne sais pas si c'est vraiment un MCP, mais j'utilise context7.
C'est super pratique pour récupérer de l'info filtrée sur les API d'apps qui ne sont pas sur la machine ni la distribution du modèle et qu'il ne peut pas interroger en local, en plus c'est in-distribution, qwen sait s'en servir sans problème.
Par contre il ne le fait pas spontanément :(
Des étapes il y en a eu. Ca fait 3 mois que je suis dessus et il y a eu moults tentatives qui ont échoué.
J'ai testé Goose, Opencode et littlecoder avant de me fixer sur un harness custom basé sur le framework qwenagent et à chaque fois je pensais que c'était le bon.
[^] # Re: Vexant
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à 3 (+6/-3).
Foutredieu….
Si j'avais pu lire ça quand je me suis lancé !
Je vais prendre le temps de tout lire, mais la première impression est : Sacré boulot !
Je vais sans nul doute apprendre quantité de choses, merci.
Ton site est désormais dans mes favoris.
[^] # Re: La fabrique à idiots
Posté par mmarc67 . En réponse au journal Ma découverte de l'IA, et de sa mise en exploitation personnelle.. Évalué à 2 (+7/-5).
Les seules questions sont passives/agressives et principalement rhétoriques, je vais quand même y répondre.
-Oui, c’est cela. Tu as bien compris cette partie.
-Non, je ne saurais pas, de toute évidence.
Mais cela ne me pose pas de problème, car qwen 3.6 35B A3B MoE Q4k, lui il saura ; et ça tombe bien parce qu’il est à ma disposition H24, et que la facture qu’il me présente se limite à celle de l’électricité que son infra consomme, càd peu ou prou celle d’un PC de jeu.
D’ailleurs c’est ce qu’il est en train de faire, non sans difficultés ; mais avec un certain succès, comme je l’ai d’ailleurs écrit dans le journal.
Claude était nécessaire pour le montage, mais pour l’exploitation je me passe de lui (pour l’instant), et c'était bien le but, même si l'abonnement Claude n'est désormais plus à ma charge.
Je comprends tout à fait que certains n’adhèrent pas à cette démarche, nous avons tous nos idiosyncrasies ; moi le premier.