De dónde viene realmente la factura, y por qué un recuento miente
El coste real de una sesión rara vez se esconde donde se le busca: un recuento de tokens confunde a menudo una relectura a tarifa de caché con una primera lectura a tarifa completa, un puñado de sesiones maratón carga con la mayor parte de la factura porque todo el historial se relee en cada llamada de herramienta, y todo archivo cargado automáticamente al inicio se vuelve a pagar entero en cada compactación, no solo una vez al principio.
Una sesión de Claude Code abierta desde la mañana, que al final del día solo plantea una última pregunta de una frase, factura sin embargo mucho más que esa frase. La razón responde a un mecanismo preciso: cada llamada de herramienta envía a Claude una nueva solicitud que lleva el historial completo de la conversación, y ese historial se relee cada vez, a la tarifa reducida de caché pero nunca a coste cero.
Lo que el caché reduce, y lo que no elimina
El caché reduce el precio de la relectura, no lo anula. Una sesión que encadena varias decenas de llamadas de herramientas hace pagar por tanto varias decenas de veces la misma porción de historial, a una tarifa más baja que la primera lectura, pero sumada a lo largo de todo el día. Aquí tienes un cálculo con cifras elegidas para el ejercicio, que puedes reproducir con las tuyas:
Historial antes de una llamada de herramienta: 40 000 tokens
Cinco llamadas de herramientas en la misma sesión
Tokens releídos en total: 40 000 x 5 = 200 000 tokens releídos a tarifa de caché
El mismo cálculo explica por qué una sesión abierta todo el día puede pesar más en una factura que varias sesiones cortas que abarquen el mismo volumen de trabajo: no es el volumen de trabajo lo que cuesta, es el número de veces que se reenvía el historial acumulado.
Lo que se recarga entero en cada compactación
El archivo de instrucciones y la memoria automática de un proyecto se cargan una vez al iniciar la sesión, y luego permanecen congelados. Solo tres eventos hacen que se relean íntegramente desde el disco: compactar la conversación, vaciarla, o reiniciar la sesión. Esta recarga se factura a la tarifa de caché mientras CLAUDE.md y la memoria no hayan cambiado desde el inicio de la sesión, y solo cae a la tarifa completa si se han modificado entretanto. Una compactación lanzada en mitad de la sesión, con el caché aún caliente, cuesta por tanto una fracción de lo que el tamaño del contexto haría suponer; es sobre todo la compactación de una sesión antigua, reanudada tras una larga pausa en la que el caché ha caducado, la que cuesta realmente caro. La diferencia entre compactar y vaciar cuenta por tanto tanto para el coste como para la continuidad de la tarea.
Un recuento que confunde una relectura en caché con una primera lectura a tarifa completa da una impresión falsa de la factura: dos líneas que llevan el mismo número de tokens pueden costar diez veces más una que la otra según vengan de una primera lectura o de una relectura en caché. El detalle de esta tarifa de caché se encuentra en la lección sobre el caché y la Batch API. Antes de juzgar un coste elevado, hay que separar por tanto dos preguntas distintas: cuántos tokens se han procesado, y a qué tarifa se ha procesado cada uno.
Lo que relee el historial entero, y cuándo
Una asociación abre una sesión de Claude Code a las nueve de la mañana para explorar una misma carpeta de documentos y encadena varias decenas de llamadas de herramientas a lo largo del día. A las cinco de la tarde, plantea una última pregunta de una frase y la envía.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: El envío de esta última pregunta hará que Claude relea todo el historial acumulado desde la mañana, a la tarifa reducida del caché, porque cada llamada de herramienta reenvía el contexto completo.
Lo que esto no establece: No establece el importe exacto de la factura de ese día, ya que este depende del número real de llamadas y del tamaño del historial en cada etapa.
Los tres calibrados falsos más frecuentes
- Demasiado amplio Esta última pregunta costará tan caro como una pregunta planteada en una sesión nueva, ya que la tarifa de caché no cambia nada el importe total.
- Demasiado estrecho Esta última pregunta no cuesta nada más que una pregunta planteada en una sesión nueva, ya que cabe en una sola frase.
- Fuera de tema Esta situación muestra sobre todo que los resultados de las llamadas de herramientas de la mañana ya no son consultables por la asociación una vez llegada la tarde.
- Una última pregunta de una frase, planteada al final de la sesión, activa de todos modos la relectura de todo el historial acumulado desde la mañana.
- La tarifa de caché reduce el coste de una relectura, nunca la hace gratuita: dos líneas del mismo tamaño pueden costar de forma muy distinta según se lean por primera vez o se relean.
- CLAUDE.md y la memoria automática de un proyecto se congelan tras el inicio y esperan una compactación, un vaciado o un reinicio de la sesión para recargarse, a tarifa de caché si no han cambiado desde el inicio de la sesión, a tarifa completa en caso contrario.
- Un coste elevado no señala forzosamente un gran volumen de trabajo: puede venir del número de veces que se reenvía el mismo historial a lo largo de la sesión.
- Cortar una sesión en varios bloques en torno a temas distintos limita la cantidad de historial que cada nueva llamada de herramienta debe hacer releer.
Antes de juzgar un coste alto o bajo, separa el volumen de tokens procesados de la tarifa aplicada, abre tu carpeta de proyecto y comprueba el tamaño del archivo de instrucciones cargado automáticamente, luego decide cortar tu próxima sesión entre dos temas sin relación en lugar de dejarla correr de un tirón.
Estos puntos dependen de una interfaz o de una regla que puede haber cambiado desde la redacción. Verifícalos en tu propia pantalla antes de fiarte de ellos.
- Abre tu carpeta de proyecto y comprueba el tamaño en tokens o en palabras del archivo de instrucciones cargado automáticamente, antes de concluir que una sesión resulta demasiado costosa por el volumen de la conversación.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Por qué aumenta el uso en una sesión larga, costes de Claude Code consultée le 2026-09-02
- Compactar la conversación, caché de prompts de Claude Code consultée le 2026-09-02