Caveman réduit le volume de texte échangé avec Claude Code. Son skill demande à l’agent de répondre dans un style télégraphique, tandis que son proxy peut compresser une partie du contexte envoyé au modèle. Ces deux mécanismes n’agissent pas sur les mêmes tokens et ne garantissent pas une réduction équivalente de la facture totale.

Voici comment installer Caveman, choisir le bon mode et mesurer son intérêt sans reprendre les pourcentages annoncés comme une promesse universelle.

Caveman, c’est quoi ?

Le projet propose aujourd’hui deux produits complémentaires :

  1. Le skill Caveman raccourcit les réponses de l’agent. Les explications deviennent plus directes, mais le code, les commandes et les messages d’erreur doivent rester exacts.
  2. Caveman Proxy compresse localement certains éléments lus par l’agent avant les appels au fournisseur. Les originaux sont conservés sur la machine pour pouvoir être récupérés.

Le skill agit surtout sur les tokens de sortie. Il ne réduit pas directement le prompt système, l’historique ou le raisonnement interne. Le proxy vise plutôt les tokens d’entrée en traitant des contenus comme les logs, JSON, diffs, résultats de recherche et extraits de code.

Installer le skill dans Claude Code

La méthode générique publiée par le dépôt officiel Caveman utilise le gestionnaire de skills :

npx skills add JuliusBrussee/caveman

Pour passer par le système de plugins de Claude Code :

claude plugin marketplace add JuliusBrussee/caveman
claude plugin install caveman@caveman

Une fois installé, Caveman peut s’activer automatiquement. Vous pouvez aussi sélectionner explicitement un niveau :

/caveman lite
/caveman full
/caveman ultra
  • lite conserve davantage d’explications ;
  • full privilégie un style très direct pour le travail quotidien ;
  • ultra compresse au maximum et convient surtout lorsque le contexte est déjà clair.

Pour revenir au comportement normal :

/caveman off

Les modes disponibles peuvent évoluer. Vérifiez la liste actuelle avec /caveman-help après l’installation.

Installer le proxy local

La version actuelle du CLI proxy exige Node.js 22.13 ou une version plus récente. Vérifiez toujours le champ engines du paquet avant l’installation, car ce prérequis peut évoluer. La procédure officielle est :

npm install -g @caveman-ai/cli
caveman setup --install
caveman claude

Le proxy transmet les requêtes au fournisseur choisi et conserve localement les données de récupération. Le projet précise également que sa télémétrie anonyme peut être désactivée :

caveman telemetry off

Avant d’utiliser ce mode sur un dépôt sensible, consultez la documentation de sécurité et vérifiez les frontières de stockage, de télémétrie et de transport correspondant à votre configuration.

Caveman réduit-il vraiment les tokens de 60 à 75 % ?

Le chiffre dépend du produit et de la métrique observée. Pour le skill, la documentation Honest Numbers indique qu’aucune réduction moyenne auditée n’est actuellement publiée. Elle estime aussi que les instructions du skill ajoutent environ 1 000 à 1 500 tokens d’entrée par tour. Sur une réponse déjà concise, ce coût fixe peut donc dépasser les tokens de sortie économisés.

Pour le proxy, l’équipe publie un benchmark Claude Code contrôlé de 54 exécutions, dont 18 paires direct/Caveman. Elle y mesure 33,2 % de tokens d’entrée en moins rapportés par le fournisseur, avec 18 contrôles de réponses exactes réussis et un intervalle à 95 % de 14,6 % à 48,5 %. Ce rapport porte sur six gros jeux de sorties déterministes, pas sur du trafic de production, et ses artefacts bruts ne sont pas publiés : il ne garantit donc pas le même gain sur votre projet.

La formulation précédente de cet article — « jusqu’à 75 % moins cher » — était donc trop générale. Caveman peut réduire certaines catégories de tokens, mais seul un test complet permet d’estimer l’effet sur le coût et la qualité de votre workflow.

Comment mesurer Caveman correctement

Comparez la même tâche, sur le même commit et avec le même modèle :

Mesure Sans Caveman Avec Caveman
Tokens d’entrée À relever À relever
Tokens de sortie À relever À relever
Nombre de tours À relever À relever
Résultat correct Oui/Non Oui/Non
Temps total À relever À relever

Testez séparément le skill et le proxy afin de savoir quel mécanisme produit le gain. Une réponse plus courte n’est pas une réussite si elle masque une hypothèse, omet une limite ou provoque plusieurs demandes de clarification.

Les limites à connaître

Le mode télégraphique convient bien aux corrections ciblées, commandes, résumés et tâches répétitives. Il est moins adapté à l’apprentissage, aux décisions d’architecture, aux explications destinées à une équipe ou aux débogages où le raisonnement doit rester explicite.

Le mode ultra peut notamment supprimer trop de contexte humain. Commencez par lite, puis augmentez seulement si les réponses restent suffisamment compréhensibles et précises.

Caveman complète d’autres approches sans les remplacer. RTK compacte les sorties shell, tandis que Graphify aide l’agent à naviguer dans une codebase et que le mode Concise agit sur le style des réponses de Claude Code.

Mon verdict

Caveman est intéressant si Claude Code produit des réponses trop longues ou charge régulièrement des sorties volumineuses. Le skill est le moyen le plus simple de tester le concept ; le proxy demande davantage de confiance et de validation technique, mais agit sur une autre partie du contexte.

Commencez avec lite, mesurez une tâche réelle et vérifiez la qualité avant de chercher le pourcentage maximal. Regardez la vidéo associée pour découvrir l’approche originale, tout en gardant à l’esprit que le projet et ses métriques ont évolué depuis sa publication.