Ir al contenido
Mastering Claude

Inicio / La API de Claude para quienes construyen

La API de Claude para quienes construyen6 minApplication

Contar antes de enviar, la ventana de contexto

Un punto de conteo dedicado devuelve el número de tokens de una petición antes de enviarla, y la ventana de contexto con la que comparar esa cifra ya no es un valor común a toda una gama de modelos, ahora varía fuertemente de una familia a otra.

Una petición enviada a la API Messages es rechazada si supera la ventana de contexto del modelo llamado, la suma de los tokens de entrada, de salida y de todo contenido puesto en caché. Un punto de conteo dedicado permite conocer ese tamaño incluso antes de enviar la petición completa.

El punto de conteo dedicado

La API expone un punto de entrada distinto de la propia API Messages, POST /v1/messages/count_tokens, que acepta la misma estructura de petición, el mismo array de mensajes, las mismas herramientas declaradas, y devuelve únicamente el número de tokens que esa petición consumiría, sin generar ninguna respuesta. Comparar esa cifra con la ventana de contexto del modelo apuntado antes del envío permite detectar un exceso sin esperar un error del servidor, y estimar el coste de la petición por adelantado.

Una ventana que ahora varía fuertemente de un modelo a otro

La ventana de contexto ya no es un valor común a toda una gama de modelos: depende de la familia precisa llamada, y un modelo más reciente no lleva necesariamente la ventana más amplia de su propio catálogo. La figura de esta lección da el detalle exacto por modelo, con su fuente y su fecha de verificación, puesto que un límite técnico de este tipo caduca en cuanto sale una nueva generación de modelos.

No confundir la API y la aplicación de chat

El mismo nombre de modelo puede llevar una ventana de contexto distinta según se llame desde la API Messages o desde la aplicación de chat, donde un plan de pago aplica su propio límite de visualización independiente del protocolo. La figura de esta lección solo documenta el valor que se aplica a una petición enviada por la API, el único pertinente para código que escribes tú mismo. El artículo de soporte que detalla los escalones por plan de pago solo documenta la aplicación de chat, nunca la API Messages: la figura de esta lección solo recoge el valor que se aplica del lado de la API. El mismo prefijo estable que llena la memoria en caché cuenta íntegramente en ese total, marcar un bloque como reutilizable no lo retira del cálculo de la ventana.

import anthropic

client = anthropic.Anthropic()

messages = [{"role": "user", "content": "Resume ce texte : " + "phrase de test. " * 200}]

compte = client.messages.count_tokens(
    model="claude-sonnet-5",
    messages=messages,
)

fenetre_du_modele = 1_000_000  # confirmada para este modelo en la figura de esta lección
max_tokens_prevus = 1024  # tokens de salida que la respuesta podrá producir como máximo
if compte.input_tokens + max_tokens_prevus > fenetre_du_modele:
    print("depassement de la fenetre de contexte")
else:
    print("jetons dans la requete :", compte.input_tokens)

El script cuenta los tokens de una petición fabricada ahí mismo, sin leer ningún archivo del proyecto, y luego compara ese total con la ventana del modelo apuntado antes de enviar nada. La misma estructura funciona para comprobar un lote de mensajes más largo, o una petición que incluya herramientas declaradas.

Figure 1

La ventana de contexto por modelo, del lado de la API

1 000 000tokens
ventana de contexto a tarificación estándar para Claude 4.6 y las generaciones siguientes, entre ellas Fable 5.1, Fable 5, Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 y Sonnet 4.6
platform.claude.com, 2026-09-02
200 000tokens
ventana de contexto de los modelos anteriores a la generación 4.6, entre ellos Haiku 4.5
platform.claude.com, 2026-09-02
Dos escalones de ventana según el modelo, válidos para la API Messages, registrados el 2 de septiembre de 2026. Los valores mostrados en la aplicación de chat en los planes de pago están documentados por separado y no se aplican aquí. Dirección al final de la lección.
Calíbralo tú mismo

Una desarrolladora llama al punto de conteo dedicado sobre una petición fabricada por un script para el modelo Claude Sonnet 5. El contador devuelve un total de 1 240 000 tokens para esta petición.

Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.

Lo que hay que recordar
  • El punto de conteo dedicado, POST /v1/messages/count_tokens, devuelve el número de tokens de una petición sin generar ninguna respuesta.
  • La ventana de contexto de la API ya no es un valor común a toda una gama de modelos, ahora varía fuertemente de una familia a otra.
  • La ventana de contexto mostrada por la aplicación de chat para un modelo dado no es necesariamente la que se aplica al mismo modelo llamado desde la API.
  • Comparar el resultado del conteo con la ventana del modelo apuntado antes del envío detecta un exceso sin esperar un error del servidor.
Hazlo ahora

Escribe un script que fabrique una petición de prueba con un contenido generado por ti mismo, llama al punto de conteo dedicado para el modelo de tu elección, y compara el resultado con la ventana de contexto indicada en la figura de esta lección.

Verificar en la fuente

Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.