Aller au contenu
Mastering Claude

Accueil / Contexte et coût

Contexte et coût8 minApplication

Cache de prompt et Batch API, deux remises à connaître

Le cache de prompt facture la lecture d'un préfixe identique à environ dix pour cent du prix d'entrée normal, avec une durée de vie qui dépend de l'offre, une heure pour la conversation principale d'un abonnement payant utilisé dans son forfait, cinq minutes pour une clé API ou un sous agent ; la Batch API, elle, traite un lot de requêtes en différé avec une remise de cinquante pour cent, sur un quota de débit séparé.

Le cache de prompt et la Batch API sont deux remises différentes sur le même coût en tokens, et elles ne récompensent pas la même chose. Le cache récompense un début de conversation qui ne change pas, la Batch API récompense un volume de requêtes qui peut attendre.

Le cache, une remise sur ce qui ne change pas

Quand un message réutilise un début identique à l'octet près à celui d'un message précédent, la lecture de cette portion déjà calculée est facturée à environ dix pour cent du prix d'entrée normal, au lieu du plein tarif. Cette remise s'applique seulement à la portion du message qui reste exactement identique : dès le premier caractère différent, la portion qui suit n'est plus considérée comme un préfixe en cache et est facturée au tarif normal.

La durée de vie du cache dépend de votre offre

Ce point diffère selon la manière dont Claude est utilisé. Sur un abonnement Claude payant, utilisé dans le cadre normal du forfait, la conversation principale de Claude Code bénéficie d'une durée de vie de cache d'une heure entre deux messages qui partagent le même début. Sur une clé d'accès à l'API, l'interface qui permet à un programme d'envoyer directement des messages à Claude sans passer par la fenêtre de conversation habituelle, ou pour un sous agent, cette durée tombe par défaut à cinq minutes, même si le compte utilise par ailleurs un abonnement payant. Ce défaut de cinq minutes n'est pas une fatalité : les réglages promptCacheTtl et subagentPromptCacheTtl permettent de demander explicitement une durée d'une heure sur une clé API ou pour un sous agent. Sans ce réglage, une pause de plus d'une heure sur la conversation principale, ou de plus de cinq minutes ailleurs, fait retomber le préfixe hors du cache : le message suivant paie de nouveau le plein tarif sur cette portion.

La Batch API, une remise sur le volume, pas sur la vitesse

La Batch API traite un ensemble de requêtes de façon asynchrone, c'est à dire sans attendre une réponse immédiate à chacune, avec une remise de cinquante pour cent sur l'entrée et sur la sortie. Elle repose sur un quota de débit distinct des limites habituelles d'une conversation, ce qui la rend utile pour un lot de tâches répétitives, par exemple reformuler la même question sur plusieurs dizaines de documents. Envoyer un tel lot suppose de passer par l'accès développeur à l'API : signalez ce besoin à la personne de votre organisation qui gère déjà cet accès, en décrivant le volume et la fréquence du lot de tâches répétitives, et continuez en attendant à traiter vos questions une par une dans la conversation habituelle.

Message 1 : instructions generales (identiques) + document A
Message 2 : memes instructions generales + document B

Ce début identique, instructions générales stables et document qui change, reste éligible à la remise de lecture de cache décrite plus haut, et rappelle le même principe posé dans les quatre leviers d'une session longue.

Figure 1

Deux remises sur le coût en tokens

10% du prix d'entree
coût de lecture d'un préfixe déjà mis en cache, côté abonnement comme côté accès API
code.claude.com/docs/en/prompt-caching, 2026-09-02
50% de remise
remise Batch API sur l'entrée et la sortie, sur un quota de débit séparé
platform.claude.com/docs/en/build-with-claude/batch-processing, 2026-09-02
Le premier chiffre porte sur la lecture d'un préfixe déjà mis en cache, le second sur un lot de requêtes traité en différé par la Batch API, deux mécanismes indépendants l'un de l'autre.
Calibrez vous-même

Une association utilise un abonnement Claude payant dans le cadre de son forfait normal. Un salarié ouvre une conversation Claude Code le matin, colle ses instructions de projet en premier message, puis pose plusieurs questions successives sur ce même projet au fil de la matinée, avec des pauses de vingt minutes entre chaque question.

Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.

Ce qu’il faut retenir
  • La lecture d'un préfixe déjà mis en cache coûte environ dix pour cent du prix d'entrée normal, côté abonnement comme côté accès API.
  • La durée de vie du cache diffère par défaut selon l'offre utilisée, abonnement ou accès API, mais les réglages promptCacheTtl et subagentPromptCacheTtl permettent de demander une heure même sur une clé API ou pour un sous agent.
  • La Batch API traite un lot de requêtes en différé avec une remise de cinquante pour cent, sur un quota de débit distinct des limites habituelles.
  • Un début de message identique à l'octet près est la condition qui déclenche la remise de lecture de cache, une seule différence au début annule la remise sur tout ce qui suit.
À faire maintenant

Dans votre prochaine conversation qui pose plusieurs questions sur le même sujet, recopiez à l'identique les toutes premières lignes d'instructions d'un message à l'autre, sans y changer un seul mot, pour que la lecture de ce début reste facturée au tarif réduit du cache.

Ce qui reste à vérifier

Ces points dépendent d’une interface ou d’une règle qui peut avoir changé depuis la rédaction. Vérifiez-les sur votre propre écran avant de vous y fier.

  • Vérifiez, dans les paramètres ou la facturation de votre compte Claude, si vous utilisez un abonnement payant dans le cadre de son forfait normal ou un accès par clé API : la durée de vie du cache n'est pas la même dans les deux cas.
Vérifier à la source

Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.