Accueil / L'API Claude pour ceux qui construisent
Compter avant d'envoyer, la fenêtre de contexte
Un point de comptage dédié rend le nombre de jetons d'une requête avant de l'envoyer, et la fenêtre de contexte à comparer à ce chiffre n'est plus une valeur commune à toute une gamme de modèles, elle varie désormais fortement d'une famille à l'autre.
Une requête envoyée à l'API Messages est rejetée si elle dépasse la fenêtre de contexte du modèle appelé, la somme des jetons d'entrée, de sortie et de tout contenu mis en cache. Un point de comptage dédié permet de connaître cette taille avant même d'envoyer la requête complète.
Le point de comptage dédié
L'API expose un point d'entrée distinct de l'API Messages elle même, POST /v1/messages/count_tokens, qui accepte la même structure de requête, le même tableau de messages, les mêmes outils déclarés, et rend uniquement le nombre de jetons que cette requête consommerait, sans générer de réponse. Comparer ce chiffre à la fenêtre de contexte du modèle visé avant l'envoi permet de détecter un dépassement sans attendre une erreur du serveur, et d'estimer le coût de la requête à l'avance.
Une fenêtre qui varie désormais fortement d'un modèle à l'autre
La fenêtre de contexte n'est plus une valeur commune à toute une gamme de modèles : elle dépend de la famille précise appelée, et un modèle plus récent ne porte pas nécessairement la fenêtre la plus large de son propre catalogue. La figure de cette leçon donne le détail exact par modèle, avec sa source et sa date de vérification, puisqu'une limite technique de ce type se périme dès qu'une nouvelle génération de modèles sort.
Ne pas confondre l'API et l'application de chat
Le même nom de modèle peut porter une fenêtre de contexte différente selon qu'il est appelé depuis l'API Messages ou depuis l'application de chat, ou un plan payant applique sa propre limite d'affichage indépendante du protocole. La figure de cette leçon ne documente que la valeur qui s'applique à une requête envoyée par l'API, la seule pertinente pour du code que vous écrivez vous même. L'article de support qui détaille les paliers par plan payant ne documente que l'application de chat, jamais l'API Messages : la figure de cette leçon ne reprend que la valeur qui s'applique côté API. Le même préfixe stable qui remplit la mémoire en cache compte intégralement dans ce total, marquer un bloc comme réutilisable ne le retire pas du calcul de la fenêtre.
import anthropic
client = anthropic.Anthropic()
messages = [{"role": "user", "content": "Resume ce texte : " + "phrase de test. " * 200}]
compte = client.messages.count_tokens(
model="claude-sonnet-5",
messages=messages,
)
fenetre_du_modele = 1_000_000 # confirmée pour ce modèle dans la figure de cette leçon
max_tokens_prevus = 1024 # jetons de sortie que la réponse pourra produire au maximum
if compte.input_tokens + max_tokens_prevus > fenetre_du_modele:
print("depassement de la fenetre de contexte")
else:
print("jetons dans la requete :", compte.input_tokens)
Le script compte les jetons d'une requête fabriquée sur place, sans lire aucun fichier du projet, puis compare ce total à la fenêtre du modèle visé avant d'envoyer quoi que ce soit. La même structure fonctionne pour vérifier un lot de messages plus long, ou une requête qui inclut des outils déclarés.
La fenêtre de contexte par modèle, côté API
Une développeuse appelle le point de comptage dédié sur une requête fabriquée par un script pour le modèle Claude Sonnet 5. Le compteur rend un total de 1 240 000 jetons pour cette requête.
Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.
Ce que cela établit : Ce compte établit que la requête telle que construite nécessite au moins 1 240 000 jetons d'entrée pour ce modèle précis, avant tout envoi réel.
Ce que cela n’établit pas : Il n'établit pas que cette requête dépassera la fenêtre de contexte du modèle, puisque la comparaison au chiffre exact de cette fenêtre n'a pas été faite dans l'énoncé.
Les trois calibrages faux les plus courants
- Trop large Ce compte établit que toute requête construite par ce même script restera toujours sous la fenêtre de contexte de n'importe quel modèle de la gamme.
- Trop étroit Ce compte n'établit rien du tout, puisqu'un seul appel au point de comptage ne renseigne jamais sur la taille réelle d'une requête.
- À côté Ce compte montre que le point de comptage dédié facture des jetons de sortie au même tarif que l'API Messages.
- Le point de comptage dédié, POST /v1/messages/count_tokens, rend le nombre de jetons d'une requête sans générer de réponse.
- La fenêtre de contexte de l'API n'est plus une valeur commune à toute une gamme de modèles, elle varie désormais fortement d'une famille à l'autre.
- La fenêtre de contexte affichée par l'application de chat pour un modèle donné n'est pas nécessairement celle qui s'applique au même modèle appelé depuis l'API.
- Comparer le résultat du comptage à la fenêtre du modèle visé avant l'envoi détecte un dépassement sans attendre une erreur du serveur.
Écrivez un script qui fabrique une requête de test avec un contenu généré par vous même, appelez le point de comptage dédié pour le modèle de votre choix, et comparez le résultat à la fenêtre de contexte indiquée dans la figure de cette leçon.
Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.
- Anthropic, tarification et fenêtre de contexte longue consultée le 2026-09-02
- Anthropic, taille de la fenêtre de contexte selon le modèle et le plan, application de chat consultée le 2026-09-02