Inicio / La API de Claude para quienes construyen
Contar antes de enviar, la ventana de contexto
Un punto de conteo dedicado devuelve el número de tokens de una petición antes de enviarla, y la ventana de contexto con la que comparar esa cifra ya no es un valor común a toda una gama de modelos, ahora varía fuertemente de una familia a otra.
Una petición enviada a la API Messages es rechazada si supera la ventana de contexto del modelo llamado, la suma de los tokens de entrada, de salida y de todo contenido puesto en caché. Un punto de conteo dedicado permite conocer ese tamaño incluso antes de enviar la petición completa.
El punto de conteo dedicado
La API expone un punto de entrada distinto de la propia API Messages, POST /v1/messages/count_tokens, que acepta la misma estructura de petición, el mismo array de mensajes, las mismas herramientas declaradas, y devuelve únicamente el número de tokens que esa petición consumiría, sin generar ninguna respuesta. Comparar esa cifra con la ventana de contexto del modelo apuntado antes del envío permite detectar un exceso sin esperar un error del servidor, y estimar el coste de la petición por adelantado.
Una ventana que ahora varía fuertemente de un modelo a otro
La ventana de contexto ya no es un valor común a toda una gama de modelos: depende de la familia precisa llamada, y un modelo más reciente no lleva necesariamente la ventana más amplia de su propio catálogo. La figura de esta lección da el detalle exacto por modelo, con su fuente y su fecha de verificación, puesto que un límite técnico de este tipo caduca en cuanto sale una nueva generación de modelos.
No confundir la API y la aplicación de chat
El mismo nombre de modelo puede llevar una ventana de contexto distinta según se llame desde la API Messages o desde la aplicación de chat, donde un plan de pago aplica su propio límite de visualización independiente del protocolo. La figura de esta lección solo documenta el valor que se aplica a una petición enviada por la API, el único pertinente para código que escribes tú mismo. El artículo de soporte que detalla los escalones por plan de pago solo documenta la aplicación de chat, nunca la API Messages: la figura de esta lección solo recoge el valor que se aplica del lado de la API. El mismo prefijo estable que llena la memoria en caché cuenta íntegramente en ese total, marcar un bloque como reutilizable no lo retira del cálculo de la ventana.
import anthropic
client = anthropic.Anthropic()
messages = [{"role": "user", "content": "Resume ce texte : " + "phrase de test. " * 200}]
compte = client.messages.count_tokens(
model="claude-sonnet-5",
messages=messages,
)
fenetre_du_modele = 1_000_000 # confirmada para este modelo en la figura de esta lección
max_tokens_prevus = 1024 # tokens de salida que la respuesta podrá producir como máximo
if compte.input_tokens + max_tokens_prevus > fenetre_du_modele:
print("depassement de la fenetre de contexte")
else:
print("jetons dans la requete :", compte.input_tokens)
El script cuenta los tokens de una petición fabricada ahí mismo, sin leer ningún archivo del proyecto, y luego compara ese total con la ventana del modelo apuntado antes de enviar nada. La misma estructura funciona para comprobar un lote de mensajes más largo, o una petición que incluya herramientas declaradas.
La ventana de contexto por modelo, del lado de la API
Una desarrolladora llama al punto de conteo dedicado sobre una petición fabricada por un script para el modelo Claude Sonnet 5. El contador devuelve un total de 1 240 000 tokens para esta petición.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: Este conteo establece que la petición tal como está construida necesita al menos 1 240 000 tokens de entrada para este modelo preciso, antes de cualquier envío real.
Lo que esto no establece: No establece que esta petición vaya a superar la ventana de contexto del modelo, puesto que la comparación con la cifra exacta de esa ventana no se ha hecho en el enunciado.
Los tres calibrados falsos más frecuentes
- Demasiado amplio Este conteo establece que toda petición construida por este mismo script permanecerá siempre por debajo de la ventana de contexto de cualquier modelo de la gama.
- Demasiado estrecho Este conteo no establece nada en absoluto, puesto que una sola llamada al punto de conteo nunca informa sobre el tamaño real de una petición.
- Fuera de lugar Este conteo muestra que el punto de conteo dedicado factura tokens de salida a la misma tarifa que la API Messages.
- El punto de conteo dedicado, POST /v1/messages/count_tokens, devuelve el número de tokens de una petición sin generar ninguna respuesta.
- La ventana de contexto de la API ya no es un valor común a toda una gama de modelos, ahora varía fuertemente de una familia a otra.
- La ventana de contexto mostrada por la aplicación de chat para un modelo dado no es necesariamente la que se aplica al mismo modelo llamado desde la API.
- Comparar el resultado del conteo con la ventana del modelo apuntado antes del envío detecta un exceso sin esperar un error del servidor.
Escribe un script que fabrique una petición de prueba con un contenido generado por ti mismo, llama al punto de conteo dedicado para el modelo de tu elección, y compara el resultado con la ventana de contexto indicada en la figura de esta lección.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Anthropic, tarificación y ventana de contexto larga consultée le 2026-09-02
- Anthropic, tamaño de la ventana de contexto según el modelo y el plan, aplicación de chat consultée le 2026-09-02