Aller au contenu
Birdpilot
Économie numérique··4 min

Un 7B local fabrique 87 % de ce qu’il affirme : le test qui nous a fait changer de modèle

Zéro coût par jeton, zéro donnée envoyée dehors. Puis nous avons vérifié chaque affirmation à la source, et le chiffre a changé toute la chaîne de production.

Nous faisons tourner un modèle de langage en local depuis juin, sur une machine à 24 Go de VRAM, pour alimenter la production éditoriale de plusieurs sites. Le raisonnement de départ tenait en une ligne : zéro coût par jeton, zéro donnée envoyée dehors, une carte déjà payée. Sur le papier, l’affaire est entendue.

Puis nous avons relu la production. Pas en diagonale : en reprenant chaque affirmation vérifiable d’un lot d’articles générés, et en la confrontant à sa source. Le résultat du 15 août 2026 : 87 % des articles contenaient au moins une affirmation fabriquée. Pas une approximation, pas une nuance discutable. Un tarif inventé, une fonctionnalité qui n’existe pas, une date fausse, une citation attribuée à quelqu’un qui ne l’a jamais dite.

Ce chiffre-là mérite qu’on s’y arrête, parce qu’il ne ressemble pas du tout à ce qu’on lit dans les benchmarks.

Vous lisez la suite le mardi

Ce genre de mesure, on en publie une par semaine dans la lettre : ce qu'on a testé, ce que ça a coûté, ce qu'on a arrêté. Quatre minutes, le mardi matin.

En validant, vous acceptez de recevoir la lettre. Désinscription en bas de chaque envoi.

Pourquoi les benchmarks ne vous préviennent pas

Un modèle de 7 milliards de paramètres s’en sort correctement sur MMLU ou HellaSwag. Ces tests posent des questions dont la réponse figure dans le jeu de test, sous forme de QCM. Le modèle choisit entre quatre options. Il ne produit rien.

La rédaction d’un article, elle, est une tâche ouverte. Vous demandez « combien coûte l’API de tel outil en août 2026 », et le modèle n’a pas le droit de répondre « je ne sais pas » : son entraînement l’a poussé à produire la suite la plus probable, et la suite la plus probable d’une phrase qui commence par « à partir de » est un nombre suivi d’une devise. Il écrit 29 dollars. Le vrai tarif était 20 dollars par siège, ce qui n’est même pas la même unité de facturation.

Plus le paramétrage est petit, plus l’effet est brutal : le modèle a moins de capacité pour stocker le fait exact, alors il compense par la forme. Un 7B écrit très bien du faux. C’est précisément ce qui le rend dangereux dans une chaîne automatisée, parce que la sortie ne ressemble jamais à une erreur.

Ce que change le passage à un 70B

Nous avons refait le même test sur un modèle de 70 milliards de paramètres quantifié, sur la même machine. Le taux d’affirmations fabriquées descend nettement. Il ne tombe pas à zéro et il ne tombera jamais à zéro.

Le gain réel est ailleurs. Le 70B accepte une consigne du type « si tu n’as pas le chiffre, écris [À VÉRIFIER] et continue ». Le 7B ignorait cette consigne la plupart du temps : il continuait d’inventer, avec le même aplomb.

C’est le vrai critère d’achat, et il ne figure sur aucune fiche produit : la capacité du modèle à obéir à une instruction d’abstention. Un modèle qui sait dire « je ne sais pas » quand on le lui demande explicitement est exploitable en production. Un modèle qui ne sait pas se taire ne l’est pas, quelle que soit sa vitesse de génération.

Le coût réel du gratuit

Un modèle local coûte 0 euro par jeton. Il coûte en revanche du temps de relecture humaine, et ce temps-là est le poste le plus cher de la chaîne. À 87 % d’articles à corriger, la relecture prend plus longtemps que la rédaction directe. L’automatisation n’a rien fait gagner : elle a déplacé le travail d’un endroit où on le voyait vers un endroit où on ne le voit plus.

La règle que nous appliquons depuis : une chaîne de génération ne se juge pas au volume produit, mais au volume publiable sans correction. Tant que ce chiffre n’est pas mesuré, la chaîne n’existe pas.

Comment mesurer chez vous, en une heure

Prenez dix sorties de votre chaîne actuelle. Surlignez chaque affirmation vérifiable : tarif, date, nom de fonctionnalité, chiffre, citation. Comptez-les, puis vérifiez-les une par une à la source. Vous obtenez deux nombres : le taux d’affirmations fausses, et le taux d’articles contenant au moins une faute. Le second décide de la publication, parce qu’un article avec une seule erreur de tarif est un article qui ne se publie pas.

Faites ce test avant d’acheter une carte graphique plus grosse. Il arrive que le problème ne soit pas le modèle mais la consigne, et une consigne se corrige en dix minutes.

La lettre du mardi

Trois notes courtes, une mesure datée, un lien qui vaut le clic. Quatre minutes de lecture, le mardi matin. Rien d'autre dans votre boîte.

En validant, vous acceptez de recevoir la lettre. Désinscription en bas de chaque envoi.

A lire ensuite