Cache de prompt et Batch API, deux remises à connaître
Le cache de prompt facture la lecture d'un préfixe identique à environ dix pour cent du prix d'entrée normal, avec une durée de vie qui dépend de l'offre, une heure pour la conversation principale d'un abonnement payant utilisé dans son forfait, cinq minutes pour une clé API ou un sous agent ; la Batch API, elle, traite un lot de requêtes en différé avec une remise de cinquante pour cent, sur un quota de débit séparé.
Le cache de prompt et la Batch API sont deux remises différentes sur le même coût en tokens, et elles ne récompensent pas la même chose. Le cache récompense un début de conversation qui ne change pas, la Batch API récompense un volume de requêtes qui peut attendre.
Le cache, une remise sur ce qui ne change pas
Quand un message réutilise un début identique à l'octet près à celui d'un message précédent, la lecture de cette portion déjà calculée est facturée à environ dix pour cent du prix d'entrée normal, au lieu du plein tarif. Cette remise s'applique seulement à la portion du message qui reste exactement identique : dès le premier caractère différent, la portion qui suit n'est plus considérée comme un préfixe en cache et est facturée au tarif normal.
La durée de vie du cache dépend de votre offre
Ce point diffère selon la manière dont Claude est utilisé. Sur un abonnement Claude payant, utilisé dans le cadre normal du forfait, la conversation principale de Claude Code bénéficie d'une durée de vie de cache d'une heure entre deux messages qui partagent le même début. Sur une clé d'accès à l'API, l'interface qui permet à un programme d'envoyer directement des messages à Claude sans passer par la fenêtre de conversation habituelle, ou pour un sous agent, cette durée tombe par défaut à cinq minutes, même si le compte utilise par ailleurs un abonnement payant. Ce défaut de cinq minutes n'est pas une fatalité : les réglages promptCacheTtl et subagentPromptCacheTtl permettent de demander explicitement une durée d'une heure sur une clé API ou pour un sous agent. Sans ce réglage, une pause de plus d'une heure sur la conversation principale, ou de plus de cinq minutes ailleurs, fait retomber le préfixe hors du cache : le message suivant paie de nouveau le plein tarif sur cette portion.
La Batch API, une remise sur le volume, pas sur la vitesse
La Batch API traite un ensemble de requêtes de façon asynchrone, c'est à dire sans attendre une réponse immédiate à chacune, avec une remise de cinquante pour cent sur l'entrée et sur la sortie. Elle repose sur un quota de débit distinct des limites habituelles d'une conversation, ce qui la rend utile pour un lot de tâches répétitives, par exemple reformuler la même question sur plusieurs dizaines de documents. Envoyer un tel lot suppose de passer par l'accès développeur à l'API : signalez ce besoin à la personne de votre organisation qui gère déjà cet accès, en décrivant le volume et la fréquence du lot de tâches répétitives, et continuez en attendant à traiter vos questions une par une dans la conversation habituelle.
Message 1 : instructions generales (identiques) + document A
Message 2 : memes instructions generales + document B
Ce début identique, instructions générales stables et document qui change, reste éligible à la remise de lecture de cache décrite plus haut, et rappelle le même principe posé dans les quatre leviers d'une session longue.
Deux remises sur le coût en tokens
Une association utilise un abonnement Claude payant dans le cadre de son forfait normal. Un salarié ouvre une conversation Claude Code le matin, colle ses instructions de projet en premier message, puis pose plusieurs questions successives sur ce même projet au fil de la matinée, avec des pauses de vingt minutes entre chaque question.
Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.
Ce que cela établit : Ce que décrit la situation reste dans la fenêtre d'une heure documentée pour la conversation principale d'un abonnement utilisé dans son forfait, donc le préfixe posé au premier message reste éligible à la remise de lecture de cache tout au long de la matinée.
Ce que cela n’établit pas : Elle n'établit pas que le même comportement s'applique à une clé API ou à un sous agent, dont la durée de vie du cache est par défaut de cinq minutes et non d'une heure, sauf à demander explicitement une heure par les réglages prévus à cet effet.
Les trois calibrages faux les plus courants
- Trop large Le cache de prompt reste actif indéfiniment tant que la conversation n'est pas fermée, quelle que soit la durée entre deux questions.
- Trop étroit Rien ne peut être dit sur le cache tant que le contenu exact des instructions de projet n'est pas connu.
- À côté Le salarié a espacé ses questions de vingt minutes parce que d'autres tâches occupaient sa matinée.
- La lecture d'un préfixe déjà mis en cache coûte environ dix pour cent du prix d'entrée normal, côté abonnement comme côté accès API.
- La durée de vie du cache diffère par défaut selon l'offre utilisée, abonnement ou accès API, mais les réglages promptCacheTtl et subagentPromptCacheTtl permettent de demander une heure même sur une clé API ou pour un sous agent.
- La Batch API traite un lot de requêtes en différé avec une remise de cinquante pour cent, sur un quota de débit distinct des limites habituelles.
- Un début de message identique à l'octet près est la condition qui déclenche la remise de lecture de cache, une seule différence au début annule la remise sur tout ce qui suit.
Dans votre prochaine conversation qui pose plusieurs questions sur le même sujet, recopiez à l'identique les toutes premières lignes d'instructions d'un message à l'autre, sans y changer un seul mot, pour que la lecture de ce début reste facturée au tarif réduit du cache.
Ces points dépendent d’une interface ou d’une règle qui peut avoir changé depuis la rédaction. Vérifiez-les sur votre propre écran avant de vous y fier.
- Vérifiez, dans les paramètres ou la facturation de votre compte Claude, si vous utilisez un abonnement payant dans le cadre de son forfait normal ou un accès par clé API : la durée de vie du cache n'est pas la même dans les deux cas.
Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.
- Mise en cache des prompts, durée de vie du cache consultée le 2026-09-02
- Prix de lecture du cache, côté API consultée le 2026-09-02
- Batch API, remise et limites de débit consultée le 2026-09-02
- Limites de débit, quota séparé pour la Batch API consultée le 2026-09-02