caveman vs ccusage : la seule paire qu'une semaine tranche

caveman réduit les tokens de sortie d'environ 65 %. ccusage vous dit quelle part de votre facture ces tokens représentaient vraiment. L'un de ces chiffres décide si l'autre compte.

Profile photo of Paul Irolla

Par Paul Irolla

Founder · AI & developer tools · Tokenade

Docteur en IA · conçoit des outils d'optimisation de tokens pour agents de code

Voir la page de l'auteur
7 min de lecture
Résumer avec l'IA
Citer cette page
Fait partie du pilier réduire l'usage des tokens dans Claude Code. C'est la seule comparaison de la catégorie qu'un chiffre unique règle complètement.

caveman ou ccusage : de quoi ai-je besoin ?

ccusage d'abord, toujours — parce qu'il produit le seul chiffre qui dit si caveman vaut la peine d'être installé. caveman réduit les tokens émis par le modèle, de 65 % en moyenne. ccusage dit quelle fraction de votre dépense ces tokens émis représentent. Pour la plupart du travail de code agentique, cette fraction est faible. Le trafic entrant — contenus de fichiers, sorties de commandes, manifestes d'outils, conversation rejouée — domine typiquement le sortant d'environ un ordre de grandeur. Coupez 65 % d'un dixième de votre facture et vous avez bougé le total de quelques points : c'est réel, et ce n'est pas ce que le titre laisse entendre. Mais cette fraction n'est pas la même pour tout le monde, et c'est toute la raison de la mesurer plutôt que de la supposer. Je maintiens un benchmark ouvert de sessions longues et je vends un outil concurrent ; sur ce benchmark, caveman n'affiche aucune économie de coût de session mesurable, ce que l'arithmétique ci-dessus prédit exactement pour des charges agentiques.

Que fait ccusage exactement ?

Il lit les transcriptions JSONL locales de votre agent et rapporte ce que vous avez dépensé. Environ 15k étoiles, 15 sources d'agents supportées, zéro installation — bunx ccusage ou npx ccusage@latest. Rapports quotidiens, hebdomadaires, mensuels et par session, répartition par modèle, suivi des tokens de cache, sortie JSON composable avec d'autres tableaux de bord. Pour les abonnés Claude Pro et Max, le point fort est la vue par bloc de facturation de 5 heures, calée sur la fenêtre glissante d'Anthropic : vous voyez où vous en êtes dedans plutôt qu'après. Il est en lecture seule et ne réduit rien, et il n'offre aucun contrefactuel — dépense observée seulement, jamais « ce que j'aurais dépensé sans l'outil X ». Le schéma JSONL qu'il lit est implicite plutôt que spécifié.

Que fait caveman exactement ?

Il bascule le modèle en parole télégraphique. Un skill ou plugin JavaScript pour plus de 30 agents, avec quatre niveaux — lite, full, ultra, wenyan — déclenchés par /caveman. La détection automatique couvre Claude Code, Codex, Gemini, Cursor, Windsurf, Cline et Copilot, et l'installation est un curl ou irm de 30 secondes. Son benchmark mérite le respect : 65 % de réduction de sortie en moyenne, fourchette 22–87 %, mesuré sur les reçus bruts de l'API Claude contre une base déjà concise. Pas une simulation, pas une estimation. Il embarque aussi deux outils côté entrée que la plupart des analyses ratent complètement :
  • caveman-shrink, un middleware MCP qui enveloppe n'importe quel serveur MCP et compresse ses descriptions d'outils — un coût permanent par tour que presque rien d'autre ne touche.
  • caveman-compress, qui réécrit CLAUDE.md et les fichiers de mémoire en forme télégraphique, environ 46 % d'économie d'entrée sur un fichier renvoyé à chaque tour.
Le coût honnête est dans son propre readme : l'application du style peut dégrader la qualité de raisonnement sur les explications nuancées.

Comment trancher en une semaine ?

Lisez un rapport et agissez dessus.
  1. Lancez npx ccusage@latest. Quelques secondes, rien à installer, il lit des transcriptions que vous avez déjà.
  2. Relevez vos totaux de tokens d'entrée et de sortie sur une semaine normale.
  3. Divisez. Si la sortie représente moins de 10 % de votre trafic, le style de parole de caveman ne peut pas bouger votre facture au-delà d'une erreur d'arrondi, aussi bien fonctionne-t-il.
  4. Puis décidez séparément pour caveman-shrink et caveman-compress, parce que ceux-là sont côté entrée et que le rapport ci-dessus ne s'y applique pas du tout.
C'est cette dernière étape qu'on saute. Le style est ce qui a rendu caveman célèbre et c'est la partie que votre rapport peut écarter ; le middleware MCP et le réécriveur de fichier de mémoire sont discrètement la moitié la plus largement utile du projet.

Quand la réponse s'inverse-t-elle ?

Quand votre usage ressemble à du chat plutôt qu'à de l'agentique. Longues explications générées, brouillons de documentation, code écrit de zéro plutôt qu'édité, et peu de lecture de fichiers. Là, le côté sortie est une vraie part de la facture, les tokens de sortie sont facturés plus cher au token, et les 65 % de caveman deviennent un chiffre qui vaut la peine. Dans quelle forme vous êtes ne se voit pas de l'extérieur, et cela change d'un projet à l'autre. Mesurez plutôt que de supposer ; c'est à cela que sert le rapport.

Que ne peuvent-ils dire ni l'un ni l'autre ?

Pourquoi vos tokens entrants sont ce qu'ils sont. ccusage rapporte des totaux, pas des causes : il ne dira pas que onze de vos vingt derniers appels d'outils ont relu les quatre mêmes fichiers, ni qu'un serveur MCP connecté que vous n'appelez jamais vous facture à chaque tour. caveman ne regarde pas du tout le trafic entrant, en dehors de ses deux outils annexes. Pour cela il faut quelque chose en limite d'outil qui rapporte par canal, ou une session que vous observez à la main.

Que montre le compteur que le ratio seul cache ?

Les tokens de cache, et la répartition par modèle. Les deux vivent dans ccusage et aucun n'apparaît dans le badge d'économies de caveman. Les tokens de cache comptent parce que l'entrée en cache est facturée une fraction de l'entrée fraîche chez tous les grands fournisseurs. Un taux de hit élevé est le plus gros actif d'une session longue, et tout ce qui le fait baisser en silence coûte plus que ne le suggère un décompte brut. Le style de parole de caveman ne touche pas au préfixe du prompt, il est donc sûr sur cet axe — mais caveman-compress réécrit votre fichier de mémoire, qui fait partie du préfixe. Réécrivez-le une fois et l'économie est permanente ; réécrivez-le chaque semaine et vous invalidez le cache à chaque fois. La répartition par modèle compte parce que le routage est en général moins cher que l'optimisation. Si un modèle se vide bien plus vite que les autres, envoyer le travail bon marché au modèle bon marché ne coûte rien à mettre en œuvre et reste invisible sans répartition. Et le compteur donne quelque chose qu'aucun benchmark ne peut fournir : votre propre variance d'une semaine à l'autre. Deux semaines ordinaires coûtent rarement pareil, et savoir de combien votre dépense bouge toute seule vous dit à partir de quelle taille un effet peut être honnêtement revendiqué.

Lequel choisir ?

Installez ccusage dans tous les cas. Gratuit, sans installation, en lecture seule, et c'est l'instrument dont dépend toute cette page. Installez caveman si votre rapport dit que la sortie compte, ou spécifiquement pour caveman-shrink si vous utilisez des serveurs MCP. Commencez en lite et lisez la sortie avant d'aller plus loin. Sautez le style caveman si vous faites du code agentique et que votre rapport confirme l'asymétrie habituelle de 10 contre 1. Ce n'est pas un mauvais outil ; c'est un outil visant la plus petite moitié de votre facture.

Comment appliquer ça aujourd'hui

  1. Obtenez le ratio entrée/sortie avant d'installer quoi que ce soit. Une commande, et la comparaison est réglée.
  2. Traitez caveman-shrink comme une décision séparée du style de parole. Autre côté du tuyau, autre arithmétique.
  3. Si vous activez le style, lisez d'abord quelques réponses en lite et jugez vous-même la qualité du raisonnement.
  4. Remesurez après une semaine, pas après une tâche.

Ce qui tourne mal (anti-patterns)

Installer caveman sur une charge agentique parce que 65 % paraît gros. C'est gros, sur le plus petit canal. Utiliser ultra sur du travail que vous devez comprendre. Le readme prévient de la dégradation du raisonnement nuancé. Croyez-le avant de déboguer une réponse fausse. Sauter caveman-shrink parce que vous avez écarté le style. Ils sont indépendants, et le middleware est celui qui n'a aucun compromis de qualité. Prendre ccusage pour un optimiseur. Il n'économise rien. Toute sa valeur est dans ce que vous faites du chiffre.
À lire aussi :

Classé n°1 au Token-Harness Optimizer Leaderboard.

Tokenade est classé n°1 au Token-Harness Optimizer Leaderboard — un benchmark de bout en bout des optimiseurs de tokens, mesuré sur de vraies sessions de code. Installez-le une fois, il agit sur chaque prompt. Compatible avec Claude Code, Cursor, Codex, Copilot et plus.