22 juin 2026

Comment les modèles d'IA locaux et les compétences personnalisées ont réduit les coûts en tokens de 90 % (et pourquoi nous avons changé)

Par Andrea Borghi
Comment les modèles d'IA locaux et les compétences personnalisées ont réduit les coûts en tokens de 90 % (et pourquoi nous avons changé)

Notre dernière facture mensuelle d'un fournisseur de modèle hébergé s'élevait à 4 200 $, et près de la moitié de cette dépense était impossible à rattacher à un résultat client. Cette seule ligne nous a poussés à reconstruire la façon dont nos agents internes réfléchissent, acheminent et paient l'intelligence. Trois mois plus tard, nous tournons plus léger, plus rapide et moins cher — et le manuel est plus simple que ce que les conférences en font.

Le premier changement a été d'admettre que toutes les tâches ne méritent pas un modèle de pointe. Router la classification simple, la mise en forme et les vérifications de schéma vers un petit modèle local a absorbé l'essentiel de notre volume sans perdre en précision là où cela comptait. Nous avons réservé les appels hébergés coûteux au travail de raisonnement véritablement difficile — cadrage stratégique, synthèse nuancée et cas limites. Le principe est sans glamour mais puissant : faire correspondre le coût de l'appel à la valeur de la réponse.

Le deuxième changement a été de traiter les compétences des agents comme du code, et non comme du chat. Chaque compétence est une petite fonction testable, avec des entrées et des sorties explicites. Lorsqu'une compétence est bien définie, un minuscule modèle local peut l'exécuter de façon fiable, et nous pouvons mettre le résultat en cache. Sur une semaine, ce sont ces appels mis en cache et servis localement qui accumulent les économies. Le modèle hébergé devient un repli, et non la valeur par défaut.

Troisièmement, nous avons mesuré les tokens comme un budget, et non comme une métrique de vanité. Nous avons suivi le coût par tâche résolue pour chaque flux de travail et refusé de livrer quoi que ce soit qui ne battait pas une référence. Cela a forcé des conversations honnêtes sur les prompts qui tiraient vraiment leur épingle du jeu et ceux qui payaient des prix premium pour du remplissage. Une quantité surprenante d'« intelligence » dans notre pipeline n'était que du boilerplate répétitif qu'un modèle à 7B de paramètres gère à l'aise.

Quatrièmement, nous avons donné à chaque agent la capacité d'escalader délibérément. Local d'abord, avec un chemin clair et documenté vers un modèle plus puissant lorsque la confiance est faible. L'équipe fait confiance au système parce que l'issue de secours est réelle, et le budget fait confiance au système parce que la plupart des appels ne l'atteignent jamais.

Enfin, nous avons cessé d'optimiser pour la démo et commencé à optimiser pour le mardi à 14 h. Des flux de travail réels, des budgets de latence réels, des plafonds de coût réels. C'est là que les modèles locaux et la conception disciplinée des compétences font leurs preuves.

Si vous fixez un tableau de bord d'utilisation qui ne se réconcilie pas avec la valeur que votre équipe livre, la voie à suivre n'est pas une nouvelle négociation de contrat. Commencez par cartographier vos appels à plus haut volume, routez les plus simples en local, formalisez le reste sous forme de compétences réutilisables, et attribuez un vrai coût par tâche à chaque flux de travail. La réduction de 90 % n'est pas une affirmation marketing — c'est ce qui sort naturellement quand on arrête de payer des prix de pointe pour des corvées.

Vous voulez une liste de contrôle d'audit de démarrage que nous utilisons pour repérer les gains faciles avant de vous engager dans l'infrastructure ? Abonnez-vous et nous vous enverrons la fiche d'une page vendredi.