Fait partie du pilier réduire l'usage des tokens dans Claude Code. C'est la seule comparaison de la catégorie qu'un chiffre unique règle complètement.
À lire aussi :
caveman ou ccusage : de quoi ai-je besoin ?
ccusage d'abord, toujours — parce qu'il produit le seul chiffre qui dit si caveman vaut la peine d'être installé. caveman réduit les tokens émis par le modèle, de 65 % en moyenne. ccusage dit quelle fraction de votre dépense ces tokens émis représentent. Pour la plupart du travail de code agentique, cette fraction est faible. Le trafic entrant — contenus de fichiers, sorties de commandes, manifestes d'outils, conversation rejouée — domine typiquement le sortant d'environ un ordre de grandeur. Coupez 65 % d'un dixième de votre facture et vous avez bougé le total de quelques points : c'est réel, et ce n'est pas ce que le titre laisse entendre. Mais cette fraction n'est pas la même pour tout le monde, et c'est toute la raison de la mesurer plutôt que de la supposer. Je maintiens un benchmark ouvert de sessions longues et je vends un outil concurrent ; sur ce benchmark, caveman n'affiche aucune économie de coût de session mesurable, ce que l'arithmétique ci-dessus prédit exactement pour des charges agentiques.Que fait ccusage exactement ?
Il lit les transcriptions JSONL locales de votre agent et rapporte ce que vous avez dépensé. Environ 15k étoiles, 15 sources d'agents supportées, zéro installation —bunx ccusage ou npx ccusage@latest. Rapports quotidiens, hebdomadaires, mensuels et par session, répartition par modèle, suivi des tokens de cache, sortie JSON composable avec d'autres tableaux de bord.
Pour les abonnés Claude Pro et Max, le point fort est la vue par bloc de facturation de 5 heures, calée sur la fenêtre glissante d'Anthropic : vous voyez où vous en êtes dedans plutôt qu'après.
Il est en lecture seule et ne réduit rien, et il n'offre aucun contrefactuel — dépense observée seulement, jamais « ce que j'aurais dépensé sans l'outil X ». Le schéma JSONL qu'il lit est implicite plutôt que spécifié.
Que fait caveman exactement ?
Il bascule le modèle en parole télégraphique. Un skill ou plugin JavaScript pour plus de 30 agents, avec quatre niveaux —lite, full, ultra, wenyan — déclenchés par /caveman. La détection automatique couvre Claude Code, Codex, Gemini, Cursor, Windsurf, Cline et Copilot, et l'installation est un curl ou irm de 30 secondes.
Son benchmark mérite le respect : 65 % de réduction de sortie en moyenne, fourchette 22–87 %, mesuré sur les reçus bruts de l'API Claude contre une base déjà concise. Pas une simulation, pas une estimation.
Il embarque aussi deux outils côté entrée que la plupart des analyses ratent complètement :
caveman-shrink, un middleware MCP qui enveloppe n'importe quel serveur MCP et compresse ses descriptions d'outils — un coût permanent par tour que presque rien d'autre ne touche.caveman-compress, qui réécritCLAUDE.mdet les fichiers de mémoire en forme télégraphique, environ 46 % d'économie d'entrée sur un fichier renvoyé à chaque tour.
Comment trancher en une semaine ?
Lisez un rapport et agissez dessus.- Lancez
npx ccusage@latest. Quelques secondes, rien à installer, il lit des transcriptions que vous avez déjà. - Relevez vos totaux de tokens d'entrée et de sortie sur une semaine normale.
- Divisez. Si la sortie représente moins de 10 % de votre trafic, le style de parole de caveman ne peut pas bouger votre facture au-delà d'une erreur d'arrondi, aussi bien fonctionne-t-il.
- Puis décidez séparément pour
caveman-shrinketcaveman-compress, parce que ceux-là sont côté entrée et que le rapport ci-dessus ne s'y applique pas du tout.
Quand la réponse s'inverse-t-elle ?
Quand votre usage ressemble à du chat plutôt qu'à de l'agentique. Longues explications générées, brouillons de documentation, code écrit de zéro plutôt qu'édité, et peu de lecture de fichiers. Là, le côté sortie est une vraie part de la facture, les tokens de sortie sont facturés plus cher au token, et les 65 % de caveman deviennent un chiffre qui vaut la peine. Dans quelle forme vous êtes ne se voit pas de l'extérieur, et cela change d'un projet à l'autre. Mesurez plutôt que de supposer ; c'est à cela que sert le rapport.Que ne peuvent-ils dire ni l'un ni l'autre ?
Pourquoi vos tokens entrants sont ce qu'ils sont. ccusage rapporte des totaux, pas des causes : il ne dira pas que onze de vos vingt derniers appels d'outils ont relu les quatre mêmes fichiers, ni qu'un serveur MCP connecté que vous n'appelez jamais vous facture à chaque tour. caveman ne regarde pas du tout le trafic entrant, en dehors de ses deux outils annexes. Pour cela il faut quelque chose en limite d'outil qui rapporte par canal, ou une session que vous observez à la main.Que montre le compteur que le ratio seul cache ?
Les tokens de cache, et la répartition par modèle. Les deux vivent dans ccusage et aucun n'apparaît dans le badge d'économies de caveman. Les tokens de cache comptent parce que l'entrée en cache est facturée une fraction de l'entrée fraîche chez tous les grands fournisseurs. Un taux de hit élevé est le plus gros actif d'une session longue, et tout ce qui le fait baisser en silence coûte plus que ne le suggère un décompte brut. Le style de parole de caveman ne touche pas au préfixe du prompt, il est donc sûr sur cet axe — maiscaveman-compress réécrit votre fichier de mémoire, qui fait partie du préfixe. Réécrivez-le une fois et l'économie est permanente ; réécrivez-le chaque semaine et vous invalidez le cache à chaque fois.
La répartition par modèle compte parce que le routage est en général moins cher que l'optimisation. Si un modèle se vide bien plus vite que les autres, envoyer le travail bon marché au modèle bon marché ne coûte rien à mettre en œuvre et reste invisible sans répartition.
Et le compteur donne quelque chose qu'aucun benchmark ne peut fournir : votre propre variance d'une semaine à l'autre. Deux semaines ordinaires coûtent rarement pareil, et savoir de combien votre dépense bouge toute seule vous dit à partir de quelle taille un effet peut être honnêtement revendiqué.
Lequel choisir ?
Installez ccusage dans tous les cas. Gratuit, sans installation, en lecture seule, et c'est l'instrument dont dépend toute cette page. Installez caveman si votre rapport dit que la sortie compte, ou spécifiquement pourcaveman-shrink si vous utilisez des serveurs MCP. Commencez en lite et lisez la sortie avant d'aller plus loin.
Sautez le style caveman si vous faites du code agentique et que votre rapport confirme l'asymétrie habituelle de 10 contre 1. Ce n'est pas un mauvais outil ; c'est un outil visant la plus petite moitié de votre facture.
Comment appliquer ça aujourd'hui
- Obtenez le ratio entrée/sortie avant d'installer quoi que ce soit. Une commande, et la comparaison est réglée.
- Traitez
caveman-shrinkcomme une décision séparée du style de parole. Autre côté du tuyau, autre arithmétique. - Si vous activez le style, lisez d'abord quelques réponses en
liteet jugez vous-même la qualité du raisonnement. - Remesurez après une semaine, pas après une tâche.
Ce qui tourne mal (anti-patterns)
Installer caveman sur une charge agentique parce que 65 % paraît gros. C'est gros, sur le plus petit canal. Utiliserultra sur du travail que vous devez comprendre. Le readme prévient de la dégradation du raisonnement nuancé. Croyez-le avant de déboguer une réponse fausse.
Sauter caveman-shrink parce que vous avez écarté le style. Ils sont indépendants, et le middleware est celui qui n'a aucun compromis de qualité.
Prendre ccusage pour un optimiseur. Il n'économise rien. Toute sa valeur est dans ce que vous faites du chiffre.
À lire aussi :
- Réduire l'usage des tokens dans Claude Code — le pilier, indépendant de l'outil
- headroom vs caveman — caveman face à un compresseur de fenêtre
- rtk vs caveman — caveman face à un filtre de sorties shell
- Heures de reset des limites Claude — le bloc de cinq heures que rapporte ccusage
- Benchmark des optimiseurs de tokens — la mesure ouverte derrière le résultat de caveman
Classé n°1 au Token-Harness Optimizer Leaderboard.
Tokenade est classé n°1 au Token-Harness Optimizer Leaderboard — un benchmark de bout en bout des optimiseurs de tokens, mesuré sur de vraies sessions de code. Installez-le une fois, il agit sur chaque prompt. Compatible avec Claude Code, Cursor, Codex, Copilot et plus.























