Las cuatro palancas de una sesión larga
Una sesión que se prolonga se apoya en solo cuatro palancas: la caché, que reutiliza un prefijo estable, la retirada de las salidas de herramientas caducadas, la compactación, que resume el historial, y la partición, que delega el trabajo voluminoso a subagentes aislados.
Una sesión de Claude Code que dura varias horas no hincha indefinidamente el mismo paquete de texto enviado al modelo en cada mensaje. Cuatro mecanismos distintos limitan lo que esa sesión arrastra consigo: la caché, que reutiliza un inicio de conversación idéntico en lugar de recalcularlo, la retirada de las salidas de herramientas que ya no sirven, la compactación, que reemplaza el historial por un resumen, y el trabajo delegado a subagentes, conversaciones separadas que tratan una parte de la tarea y solo devuelven su conclusión.
La caché, el filtrado, el resumen, la delegación
La caché de prompt retiene los cálculos hechos sobre un inicio de conversación, llamado prefijo, mientras ese prefijo siga siendo idéntico byte a byte de un mensaje al siguiente. En cuanto algo cambia al principio mismo de ese prefijo, todo lo que sigue debe recalcularse. Por eso la posición importa: las instrucciones generales y el contexto del proyecto conviene que se queden al principio, inmóviles, mientras las preguntas que cambian llegan después.
La retirada de las salidas de herramientas caducadas, lo que este curso llama enmascaramiento, despeja los resultados de llamadas antiguas que ya no sirven a la respuesta en curso, un principio real aunque ninguna documentación pública de Anthropic lo llame así palabra por palabra. La compactación, por su parte, resume el historial de mensajes en un texto más corto cuando la conversación se acerca a su límite, un tema detallado en compactar, borrar, leer solo lo necesario. La partición, por último, confía una porción del trabajo, una búsqueda larga, la lectura de varios archivos, a un subagente que trabaja en su propia conversación y solo devuelve su conclusión, lo que evita cargar la conversación principal con el detalle de su búsqueda.
Un solo gesto basta para activar la primera palanca
Estos cuatro mecanismos no se activan todos en cada sesión. Una conversación corta, que se mantiene lejos del límite de contexto, no dispara ninguna compactación, y una tarea que no requiere ninguna búsqueda extensa no delega nada a un subagente. La caché, en cambio, se activa desde el segundo mensaje de una misma conversación, sin ningún ajuste particular que configurar, con una condición: que el inicio del mensaje siga siendo idéntico.
Mensaje 1: instrucciones del proyecto (identicas cada vez) + pregunta A
Mensaje 2: las mismas instrucciones del proyecto + pregunta B
El segundo mensaje reutiliza el cálculo ya hecho sobre las instrucciones del proyecto, a condición de que no hayan cambiado ni un carácter entre ambos mensajes.
Las cuatro palancas apiladas
Un colaborador abre una sesión de Claude Code por la mañana y plantea sus instrucciones generales en el primer mensaje. Luego encadena, durante varias horas, decenas de preguntas distintas sobre el mismo proyecto, cada una enviada como un nuevo mensaje en la misma conversación.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: El primer mensaje forma un inicio de conversación estable que la caché puede reutilizar tal cual en cada nueva pregunta planteada en la misma conversación.
Lo que esto no establece: No establece que la sesión haya disparado una compactación o que una parte del trabajo se haya delegado a un subagente, dos mecanismos que dependen de condiciones que no se describen aquí.
Los tres calibrados falsos más frecuentes
- Demasiado amplio Los cuatro mecanismos, caché, retirada de las salidas caducadas, compactación y partición, se activaron necesariamente todos durante esta sesión.
- Demasiado estrecho No se puede afirmar nada sobre esta sesión mientras no se conozca el número exacto de preguntas planteadas.
- Fuera de lugar El colaborador trató varios temas distintos en la misma conversación a lo largo de su jornada de trabajo.
- Una sesión larga se apoya en cuatro mecanismos distintos, la caché, la retirada de las salidas de herramientas caducadas, la compactación y la delegación a subagentes, no en un único ajuste global.
- La caché de prompt exige un inicio de conversación idéntico byte a byte para seguir aplicándose de un mensaje al siguiente.
- La compactación resume el historial de mensajes cuando la conversación se acerca a su límite, sin modificar los archivos del proyecto.
- Un subagente trata una porción del trabajo en su propia conversación y solo devuelve su conclusión a la conversación principal.
- Colocar las instrucciones generales del proyecto en el primerísimo mensaje es lo que permite que la caché se aplique desde el mensaje siguiente.
Antes de tu próxima sesión larga en Claude Code, escribe tus instrucciones generales y el contexto estable del proyecto en el primerísimo mensaje, luego plantea tus preguntas siguientes a continuación en la misma conversación.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Ingeniería del contexto para agentes de IA consultée le 2026-09-02
- Context editing, retirada de las salidas de herramientas caducadas consultée le 2026-09-02
- Gestión de los costes de Claude Code consultée le 2026-09-02