Caché de prompt y Batch API, dos descuentos que conocer
La caché de prompt factura la lectura de un prefijo idéntico a aproximadamente el diez por ciento del precio de entrada normal, con una duración de vida que depende de la oferta, una hora para la conversación principal de una suscripción de pago utilizada dentro de su plan, cinco minutos para una clave de API o un subagente; la Batch API, por su parte, procesa un lote de solicitudes de forma diferida con un descuento del cincuenta por ciento, sobre una cuota de tasa separada.
La caché de prompt y la Batch API son dos descuentos diferentes sobre el mismo coste en tokens, y no recompensan lo mismo. La caché recompensa un inicio de conversación que no cambia, la Batch API recompensa un volumen de solicitudes que puede esperar.
La caché, un descuento sobre lo que no cambia
Cuando un mensaje reutiliza un inicio idéntico byte a byte al de un mensaje anterior, la lectura de esa porción ya calculada se factura a aproximadamente el diez por ciento del precio de entrada normal, en lugar de la tarifa completa. Este descuento se aplica solo a la porción del mensaje que permanece exactamente idéntica: desde el primer carácter diferente, la porción que sigue deja de considerarse un prefijo en caché y se factura a la tarifa normal.
La duración de vida de la caché depende de tu oferta
Este punto difiere según la manera en que se utiliza Claude. En una suscripción de pago a Claude, utilizada dentro del marco normal del plan, la conversación principal de Claude Code se beneficia de una duración de vida de caché de una hora entre dos mensajes que comparten el mismo inicio. En una clave de acceso a la API, la interfaz que permite a un programa enviar mensajes directamente a Claude sin pasar por la ventana de conversación habitual, o para un subagente, esa duración cae por defecto a cinco minutos, incluso si la cuenta utiliza además una suscripción de pago. Este valor por defecto de cinco minutos no es una fatalidad: los ajustes promptCacheTtl y subagentPromptCacheTtl permiten pedir explícitamente una duración de una hora en una clave de API o para un subagente. Sin ese ajuste, una pausa de más de una hora en la conversación principal, o de más de cinco minutos en cualquier otro caso, hace que el prefijo salga de la caché: el siguiente mensaje vuelve a pagar la tarifa completa sobre esa porción.
La Batch API, un descuento sobre el volumen, no sobre la velocidad
La Batch API procesa un conjunto de solicitudes de forma asíncrona, es decir, sin esperar una respuesta inmediata a cada una, con un descuento del cincuenta por ciento tanto en la entrada como en la salida. Se apoya en una cuota de tasa distinta de los límites habituales de una conversación, lo que la hace útil para un lote de tareas repetitivas, por ejemplo reformular la misma pregunta sobre varias decenas de documentos. Enviar un lote así supone pasar por el acceso de desarrollador a la API: comunica esta necesidad a la persona de tu organización que ya gestiona ese acceso, describiendo el volumen y la frecuencia del lote de tareas repetitivas, y mientras tanto sigue tratando tus preguntas una a una en la conversación habitual.
Mensaje 1: instrucciones generales (identicas) + documento A
Mensaje 2: las mismas instrucciones generales + documento B
Este inicio idéntico, instrucciones generales estables y documento que cambia, sigue siendo elegible para el descuento de lectura de caché descrito más arriba, y recuerda el mismo principio planteado en las cuatro palancas de una sesión larga.
Dos descuentos sobre el coste en tokens
Una asociación utiliza una suscripción de pago a Claude dentro del marco normal de su plan. Un empleado abre una conversación de Claude Code por la mañana, pega sus instrucciones de proyecto en el primer mensaje, y luego plantea varias preguntas sucesivas sobre ese mismo proyecto a lo largo de la mañana, con pausas de veinte minutos entre cada pregunta.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: Lo que describe la situación se mantiene dentro de la ventana de una hora documentada para la conversación principal de una suscripción utilizada dentro de su plan, por lo que el prefijo planteado en el primer mensaje sigue siendo elegible para el descuento de lectura de caché durante toda la mañana.
Lo que esto no establece: No establece que el mismo comportamiento se aplique a una clave de API o a un subagente, cuya duración de vida de caché es por defecto de cinco minutos y no de una hora, salvo que se pida explícitamente una hora mediante los ajustes previstos para ello.
Los tres calibrados falsos más frecuentes
- Demasiado amplio La caché de prompt permanece activa indefinidamente mientras la conversación no se cierre, sea cual sea la duración entre dos preguntas.
- Demasiado estrecho No se puede afirmar nada sobre la caché mientras no se conozca el contenido exacto de las instrucciones de proyecto.
- Fuera de lugar El empleado espació sus preguntas veinte minutos porque otras tareas ocupaban su mañana.
- La lectura de un prefijo ya guardado en caché cuesta aproximadamente el diez por ciento del precio de entrada normal, tanto en la suscripción como en el acceso por API.
- La duración de vida de la caché difiere por defecto según la oferta utilizada, suscripción o acceso por API, pero los ajustes promptCacheTtl y subagentPromptCacheTtl permiten pedir una hora incluso en una clave de API o para un subagente.
- La Batch API procesa un lote de solicitudes de forma diferida con un descuento del cincuenta por ciento, sobre una cuota de tasa distinta de los límites habituales.
- Un inicio de mensaje idéntico byte a byte es la condición que activa el descuento de lectura de caché, una sola diferencia al principio anula el descuento sobre todo lo que sigue.
En tu próxima conversación que plantee varias preguntas sobre el mismo tema, copia de forma idéntica las primerísimas líneas de instrucciones de un mensaje a otro, sin cambiar ni una sola palabra, para que la lectura de ese inicio siga facturándose a la tarifa reducida de la caché.
Estos puntos dependen de una interfaz o de una regla que puede haber cambiado desde la redacción. Verifícalos en tu propia pantalla antes de fiarte de ellos.
- Verifica, en los ajustes o la facturación de tu cuenta de Claude, si utilizas una suscripción de pago dentro de su plan normal o un acceso por clave de API: la duración de vida de la caché no es la misma en ambos casos.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Caché de prompts, duración de vida de la caché consultée le 2026-09-02
- Precio de lectura de la caché, lado API consultée le 2026-09-02
- Batch API, descuento y límites de tasa consultée le 2026-09-02
- Límites de tasa, cuota separada para la Batch API consultée le 2026-09-02