Aller au contenu
Mastering Claude

Accueil / L'API Claude pour ceux qui construisent

L'API Claude pour ceux qui construisent6 minApplication

Compter avant d'envoyer, la fenêtre de contexte

Un point de comptage dédié rend le nombre de jetons d'une requête avant de l'envoyer, et la fenêtre de contexte à comparer à ce chiffre n'est plus une valeur commune à toute une gamme de modèles, elle varie désormais fortement d'une famille à l'autre.

Une requête envoyée à l'API Messages est rejetée si elle dépasse la fenêtre de contexte du modèle appelé, la somme des jetons d'entrée, de sortie et de tout contenu mis en cache. Un point de comptage dédié permet de connaître cette taille avant même d'envoyer la requête complète.

Le point de comptage dédié

L'API expose un point d'entrée distinct de l'API Messages elle même, POST /v1/messages/count_tokens, qui accepte la même structure de requête, le même tableau de messages, les mêmes outils déclarés, et rend uniquement le nombre de jetons que cette requête consommerait, sans générer de réponse. Comparer ce chiffre à la fenêtre de contexte du modèle visé avant l'envoi permet de détecter un dépassement sans attendre une erreur du serveur, et d'estimer le coût de la requête à l'avance.

Une fenêtre qui varie désormais fortement d'un modèle à l'autre

La fenêtre de contexte n'est plus une valeur commune à toute une gamme de modèles : elle dépend de la famille précise appelée, et un modèle plus récent ne porte pas nécessairement la fenêtre la plus large de son propre catalogue. La figure de cette leçon donne le détail exact par modèle, avec sa source et sa date de vérification, puisqu'une limite technique de ce type se périme dès qu'une nouvelle génération de modèles sort.

Ne pas confondre l'API et l'application de chat

Le même nom de modèle peut porter une fenêtre de contexte différente selon qu'il est appelé depuis l'API Messages ou depuis l'application de chat, ou un plan payant applique sa propre limite d'affichage indépendante du protocole. La figure de cette leçon ne documente que la valeur qui s'applique à une requête envoyée par l'API, la seule pertinente pour du code que vous écrivez vous même. L'article de support qui détaille les paliers par plan payant ne documente que l'application de chat, jamais l'API Messages : la figure de cette leçon ne reprend que la valeur qui s'applique côté API. Le même préfixe stable qui remplit la mémoire en cache compte intégralement dans ce total, marquer un bloc comme réutilisable ne le retire pas du calcul de la fenêtre.

import anthropic

client = anthropic.Anthropic()

messages = [{"role": "user", "content": "Resume ce texte : " + "phrase de test. " * 200}]

compte = client.messages.count_tokens(
    model="claude-sonnet-5",
    messages=messages,
)

fenetre_du_modele = 1_000_000  # confirmée pour ce modèle dans la figure de cette leçon
max_tokens_prevus = 1024  # jetons de sortie que la réponse pourra produire au maximum
if compte.input_tokens + max_tokens_prevus > fenetre_du_modele:
    print("depassement de la fenetre de contexte")
else:
    print("jetons dans la requete :", compte.input_tokens)

Le script compte les jetons d'une requête fabriquée sur place, sans lire aucun fichier du projet, puis compare ce total à la fenêtre du modèle visé avant d'envoyer quoi que ce soit. La même structure fonctionne pour vérifier un lot de messages plus long, ou une requête qui inclut des outils déclarés.

Figure 1

La fenêtre de contexte par modèle, côté API

1 000 000jetons
fenêtre de contexte à tarification standard pour Claude 4.6 et les générations suivantes, dont Fable 5.1, Fable 5, Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 et Sonnet 4.6
platform.claude.com, 2026-09-02
200 000jetons
fenêtre de contexte des modèles antérieurs à la génération 4.6, dont Haiku 4.5
platform.claude.com, 2026-09-02
Deux paliers de fenêtre selon le modèle, valables pour l'API Messages, relevés le 2 septembre 2026. Les valeurs affichées dans l'application de chat sur les plans payants sont documentées séparément et ne s'appliquent pas ici. Adresse en fin de leçon.
Calibrez vous-même

Une développeuse appelle le point de comptage dédié sur une requête fabriquée par un script pour le modèle Claude Sonnet 5. Le compteur rend un total de 1 240 000 jetons pour cette requête.

Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.

Ce qu’il faut retenir
  • Le point de comptage dédié, POST /v1/messages/count_tokens, rend le nombre de jetons d'une requête sans générer de réponse.
  • La fenêtre de contexte de l'API n'est plus une valeur commune à toute une gamme de modèles, elle varie désormais fortement d'une famille à l'autre.
  • La fenêtre de contexte affichée par l'application de chat pour un modèle donné n'est pas nécessairement celle qui s'applique au même modèle appelé depuis l'API.
  • Comparer le résultat du comptage à la fenêtre du modèle visé avant l'envoi détecte un dépassement sans attendre une erreur du serveur.
À faire maintenant

Écrivez un script qui fabrique une requête de test avec un contenu généré par vous même, appelez le point de comptage dédié pour le modèle de votre choix, et comparez le résultat à la fenêtre de contexte indiquée dans la figure de cette leçon.

Vérifier à la source

Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.