Qu'est-ce qu'une utilisation des outils MCP économe en tokens ?
Une utilisation des outils MCP économe en tokens, cela signifie que vous ne payez les tokens du schéma d'un outil que lorsque l'agent l'appelle réellement, et que vous compactez ce que l'outil renvoie avant que cela n'atterrisse dans le contexte — au lieu de précharger le manifeste complet de chaque serveur à chaque tour et de coller la sortie brute telle quelle. Le comportement par défaut de la plupart des agents est tout l'inverse de l'efficacité : connectez un serveur MCP et sa liste d'outils entière voyage avec chaque message, puis tout ce qu'un outil renvoie est déversé sans filtre dans la context window. Ce sont là deux taxes fixes que vous pouvez pour l'essentiel cesser de payer. Je construis du tooling sur les tokens pour gagner ma vie, et MCP est l'endroit où je vois le plus de gaspillage par unité d'effort de correction. Le protocole est excellent — c'est la manière la plus propre que j'aie trouvée de donner à un agent de véritables capacités. Mais la façon dont il est câblé par défaut traite les tokens comme gratuits, et ils ne le sont catégoriquement pas. Cet article est la version praticienne de la correction : quoi faire au niveau du schéma, quoi faire au niveau de la sortie, et là où un outil peut simplement s'en charger pour que vous n'ayez plus à y penser. C'est une ramification de la question plus large de comment réduire l'utilisation de tokens d'un agent de codage IA. Si vous voulez le menu complet des leviers, commencez par là. Ici, je reste centré sur MCP.Pourquoi les outils MCP coûtent-ils plus de tokens que vous ne le pensez ?
Les outils MCP coûtent plus que vous ne le pensez parce que vous payez deux fois : une fois pour le schéma à l'aller, et encore pour la sortie au retour — et les deux se produisent à chaque tour, ce que vous surveillez rarement. Une session de codage n'est pas une seule requête ; ce sont des dizaines ou des centaines d'allers-retours. Chaque aller-retour renvoie le system prompt plus le manifeste d'outils de chaque serveur connecté, et chaque appel d'outil ajoute son résultat brut à la transcription en cours. Le côté schéma est la partie que les gens sous-estiment. Un gros serveur embarque beaucoup d'outils, et chaque outil porte un nom, une description et un schéma de paramètres complet. Connectez deux ou trois serveurs lourds et vous avez dépensé une part non négligeable de votre fenêtre en texte que le modèle ignore la plupart du temps. Avec Claude Opus 4.8 à 5 $ par million de tokens d'entrée, un manifeste épais représente des centimes par tour — anodin une fois, douloureux sur 150 tours dans une session. Le prompt caching aide ici, puisque les cache reads tournent à environ 10 % du prix d'entrée, mais le caching est une remise sur une facture que vous pouvez souvent éviter entièrement : un manifeste que vous n'appelez jamais représente des tokens que vous n'aviez jamais besoin d'envoyer, mis en cache ou non. Le côté sortie est plus sournois. Les outils adorent renvoyer du JSON — et le JSON est verbeux, répétitif et plein de champs que l'agent ne lira jamais. Un appel « lister les fichiers » peut renvoyer quelques milliers de tokens de métadonnées pour que le modèle puisse utiliser un seul chemin. Un web fetch renvoie tout le DOM alors que l'agent voulait un seul titre. Rien de tout cela n'est faux, à proprement parler ; c'est juste non filtré, et le non filtré coûte cher. Sur Sonnet 5 (2 $ / 10 $ par MTok) ou Haiku 4.5 (1 $ / 5 $), les chiffres absolus diminuent, et sur GPT-5.5 (5 $ / 30 $) le côté sortie mord plus fort parce que l'output est facturé au prix fort — mais le ratio tient pour tous : vous payez en continu des octets que le modèle n'utilise pas. Les chiffres derrière tout cela sont rassemblés dans notre décryptage des coûts de tokens des agents de codage IA, et les tarifs par modèle dans notre référence sur le prix des tokens d'API LLM.Comment réduire le coût du schéma ?
Vous réduisez le coût du schéma en chargeant les manifestes d'outils paresseusement — en envoyant un index léger en amont et en ne résolvant le schéma complet d'un outil que lorsque l'agent le sollicite. C'est le geste à plus fort levier du côté entrée, et il mérite son propre traitement : voir chargement paresseux de MCP pour les mécanismes. La version courte, c'est que le plancher par tour — les tokens que vous payez avant d'avoir dit quoi que ce soit d'utile — s'effondre vers zéro pour les serveurs que vous n'utilisez pas actuellement, tout en conservant chaque capacité. Si vous préférez ne pas attendre qu'une couche le fasse, vous pouvez obtenir l'essentiel du bénéfice à la main dès aujourd'hui :- Auditez ce qui est connecté. Listez vos serveurs actifs et demandez-vous, honnêtement, pour chacun : est-ce que j'appelle ça la plupart des sessions, ou une fois par semaine ? Le coût du manifeste est payé quotidiennement, quoi qu'il en soit.
- Élaguez sans pitié. Le token le moins cher est celui que vous n'envoyez jamais. Un serveur que vous touchez une fois par semaine est généralement mieux connecté à la demande que laissé branché en permanence.
- Gardez-en un ou deux toujours actifs. Choisissez les serveurs qui se déclenchent à la plupart des tours ; traitez le reste comme des candidats au chargement paresseux. Notre classement des meilleurs serveurs MCP pour Claude Code note les serveurs courants exactement sur ce critère — le coût en tokens, pas seulement l'utilité.
Comment réduire le coût de la sortie ?
Vous réduisez le coût de la sortie avec l'output filtering — en compactant le résultat d'un outil aux octets que l'agent va réellement utiliser avant que ce résultat n'entre dans le contexte. Le principe est le même que du côté schéma, appliqué au trajet retour : la plus grande partie de ce qu'un outil émet est de la structure, de la répétition et des champs que personne ne lit, et vous pouvez replier tout cela sans perdre le signal. En pratique, cela revient à empiler plusieurs choses :- Supprimez le boilerplate. Les enveloppes de pagination, les timestamps, les ETags, les clés répétées sur les éléments d'un tableau — rien de tout cela n'aide le modèle à raisonner. La compression de contexte l'élague.
- Dédupliquez. La sortie d'un outil est pleine de lignes quasi identiques. Les réduire à un représentant plus un décompte conserve le sens à une fraction des tokens.
- Résumez la longue traîne. Quand un fetch renvoie un document de 40 Ko et que l'agent voulait une seule section, renvoyer la section plus une carte d'une ligne du reste vaut mieux que renvoyer le tout.
Comment appliquer un MCP économe en tokens dès aujourd'hui
Vous pouvez passer de « je fuis des tokens » à « je paie ce que j'utilise » en un après-midi, grosso modo par ordre d'effort :- Mesurez d'abord. Lancez une session normale et regardez combien de tokens d'entrée atterrissent avant votre première vraie instruction, et quelle est la taille de votre résultat d'outil moyen. Estimer à l'œil n'est pas mesurer. Notre guide mesurer l'utilisation de tokens d'un agent couvre cela, et vous pouvez vérifier des chiffres approximatifs avec le compteur de tokens et le calculateur de coût de tokens LLM.
- Élaguez et chargez paresseusement le côté schéma. Déconnectez les serveurs que vous utilisez occasionnellement ; gardez le ou les deux qui se déclenchent constamment. C'est du chargement paresseux manuel, et c'est gratuit.
- Filtrez le côté sortie. Là où vous contrôlez un outil, renvoyez la forme minimale utile. Là où vous ne le contrôlez pas, placez une couche de compaction devant lui.
- Laissez une couche le faire automatiquement. La discipline manuelle est un vrai travail et vous vous tromperez un jour chargé. C'est là qu'intervient Tokenade : il se place entre votre agent et ses serveurs MCP et charge les manifestes paresseusement — le schéma complet n'est récupéré que lorsque l'agent sollicite un outil — de sorte qu'une configuration à quatre ou cinq serveurs coûte à peu près ce que coûtait un seul serveur. Il compacte la sortie bruyante des outils avant qu'elle n'atteigne le contexte, remplace les lectures de fichiers entiers par de la semantic search, et affiche les économies sur un dashboard pour que vous puissiez voir le plancher par tour baisser réellement. Il fonctionne de la même manière sur Claude Code, Cursor, Codex, Copilot et Windsurf, le tier gratuit couvre environ 10M tokens par mois, et Pro est à 24,90 $/mois (hors taxes, US) avec postes illimités. Il est source-available sous licence MIT, vous pouvez donc lire exactement ce qu'il fait à votre trafic avant de lui confier quoi que ce soit.
Ce qui tourne mal (anti-patterns)
Les modes d'échec ici viennent surtout de la confusion entre « connecté » et « gratuit », et entre « renvoyé » et « nécessaire ». Quelques-uns à surveiller :- Accumuler les serveurs. Connecter chaque serveur MCP intéressant « au cas où » est l'habitude la plus coûteuse du côté schéma. Chacun ajoute un surcoût fixe par tour qu'il se déclenche ou non. Si vous ne paieriez pas un abonnement mensuel pour un outil que vous utilisez une fois par quinzaine, ne payez pas non plus une taxe par tour pour lui.
- Faire confiance à la sortie brute. Laisser les outils déverser du JSON non filtré dans le contexte est l'habitude la plus coûteuse du côté sortie. Le modèle en lit une fraction et vous payez pour le tout. Compactez avant le contexte, pas après.
- Filtrer trop fort. Un élagage de sortie trop agressif peut supprimer le seul champ dont l'agent avait réellement besoin et provoquer un nouvel appel — ce qui coûte plus que les octets que vous avez économisés. Filtrez le boilerplate et la longue traîne ; conservez le signal.
- Charger paresseusement les mauvais outils. Différer un outil qui se déclenche à la plupart des tours ne fait qu'ajouter un aller-retour pour résoudre son schéma à chaque fois. Le chargement paresseux est pour la longue traîne, pas pour le ou les deux serveurs dans lesquels vous vivez.
- Supposer que le caching le rend gratuit. Le prompt caching réduit le coût de renvoi à environ 10 % de l'entrée, ce qui est excellent — mais il est froid au premier tour, casse quand un manifeste change, et ne bat jamais le fait de ne pas envoyer les octets du tout. C'est une remise, pas une exonération. (Si vous continuez quand même à atteindre des limites, c'est généralement un problème de rate-limit, et moins de tokens aide là aussi.)
À voir aussi :
- Comment réduire l'utilisation de tokens d'un agent de codage IA
- Chargement paresseux de MCP
- Meilleurs serveurs MCP pour Claude Code
- Claude Code MCP : comment le configurer
- Tool calling (function calling) — la primitive sur laquelle repose tout serveur MCP
- MCP — glossaire
- Output filtering — glossaire
Classé n°1 au Token-Harness Optimizer Leaderboard.
Tokenade est classé n°1 au Token-Harness Optimizer Leaderboard — un benchmark de bout en bout des optimiseurs de tokens, mesuré sur de vraies sessions de code. Installez-le une fois, il agit sur chaque prompt. Compatible avec Claude Code, Cursor, Codex, Copilot et plus.