Contexte et coût
- 01Les quatre leviers d'une session longue8 min
Une session qui dure repose sur quatre leviers seulement : le cache, qui réutilise un préfixe stable, le retrait des sorties d'outils périmées, la compaction, qui résume l'historique, et le partitionnement, qui délègue le travail volumineux à des sous agents isolés.
- 02Compacter, effacer, lire juste ce qu'il faut7 min
La commande /compact remplace l'historique de messages par un résumé et poursuit la même conversation, la commande /clear efface cet historique et repart de zéro, et dans les deux cas les fichiers du projet sur le disque ne bougent pas : le geste qui économise le plus reste de ne faire lire à Claude que la tranche pertinente d'un fichier.
- 03Cache de prompt et Batch API, deux remises à connaître8 min
Le cache de prompt facture la lecture d'un préfixe identique à environ dix pour cent du prix d'entrée normal, avec une durée de vie qui dépend de l'offre, une heure pour la conversation principale d'un abonnement payant utilisé dans son forfait, cinq minutes pour une clé API ou un sous agent ; la Batch API, elle, traite un lot de requêtes en différé avec une remise de cinquante pour cent, sur un quota de débit séparé.
- 04Le seuil d'auto-compactage ne fait pas ce qu'on croit7 min
Le seuil d'auto-compactage déclenche un résumé de la conversation quand le contexte l'atteint, ce n'est pas un mur qui ferme la fenêtre : une valeur réglée au dessus de la fenêtre réelle du modèle actif est plafonnée à cette fenêtre, un comportement documenté dont l'absence d'avertissement à l'écran reste à vérifier soi même.
- 05Une fenêtre de contexte ne suit pas le modèle7 min
Une fenêtre étendue ne semble pas se reporter automatiquement d'un modèle à l'autre, un point que la documentation ne tranche pas explicitement : le suffixe de taille est à retaper par prudence à chaque changement de modèle par la commande /model, sauf pour deux modèles nommés dont le comportement diffère du cas général.
- 06D'où vient vraiment la facture, et pourquoi un décompte ment9 min
Le coût réel d'une session se cache rarement où on le cherche : un décompte de jetons confond souvent une relecture au tarif de cache avec une première lecture au tarif plein, une poignée de sessions marathon porte l'essentiel de la facture parce que l'historique entier se relit à chaque appel d'outil, et tout fichier chargé automatiquement au démarrage se repaie en entier à chaque compaction, pas seulement une fois au début.
- 07Quota, débit et routage vers le modèle le moins cher8 min
Deux plafonds distincts gouvernent une session, le coût en argent et le débit en jetons par minute, et les deux se traitent par le même réflexe : router les tâches répétitives vers Haiku ou Sonnet, garder Opus pour le raisonnement difficile, et attendre en respectant un délai croissant après une erreur 429 plutôt que de relancer aussitôt.