Ir al contenido
Mastering Claude

Inicio

Ir al fondo7 lecciones54 min

Contexto y coste

  1. 01Las cuatro palancas de una sesión larga8 min

    Una sesión que se prolonga se apoya en solo cuatro palancas: la caché, que reutiliza un prefijo estable, la retirada de las salidas de herramientas caducadas, la compactación, que resume el historial, y la partición, que delega el trabajo voluminoso a subagentes aislados.

  2. 02Compactar, borrar, leer solo lo necesario7 min

    El comando /compact reemplaza el historial de mensajes por un resumen y continúa la misma conversación, el comando /clear borra ese historial y empieza de cero, y en ambos casos los archivos del proyecto en disco no se mueven: el gesto que más ahorra sigue siendo hacer que Claude lea solo el tramo pertinente de un archivo.

  3. 03Caché de prompt y Batch API, dos descuentos que conocer8 min

    La caché de prompt factura la lectura de un prefijo idéntico a aproximadamente el diez por ciento del precio de entrada normal, con una duración de vida que depende de la oferta, una hora para la conversación principal de una suscripción de pago utilizada dentro de su plan, cinco minutos para una clave de API o un subagente; la Batch API, por su parte, procesa un lote de solicitudes de forma diferida con un descuento del cincuenta por ciento, sobre una cuota de tasa separada.

  4. 04El umbral de autocompactado no hace lo que se cree7 min

    El umbral de autocompactado activa un resumen de la conversación cuando el contexto lo alcanza, no es un muro que cierre la ventana: un valor configurado por encima de la ventana real del modelo activo queda limitado a esa ventana, un comportamiento documentado cuya ausencia de aviso en pantalla queda por verificar uno mismo.

  5. 05Una ventana de contexto no sigue al modelo7 min

    Una ventana ampliada no parece trasladarse automáticamente de un modelo a otro, un punto que la documentación no zanja explícitamente: el sufijo de tamaño hay que volver a escribirlo por precaución en cada cambio de modelo mediante el comando /model, salvo para dos modelos nombrados cuyo comportamiento difiere del caso general.

  6. 06De dónde viene realmente la factura, y por qué un recuento miente9 min

    El coste real de una sesión rara vez se esconde donde se le busca: un recuento de tokens confunde a menudo una relectura a tarifa de caché con una primera lectura a tarifa completa, un puñado de sesiones maratón carga con la mayor parte de la factura porque todo el historial se relee en cada llamada de herramienta, y todo archivo cargado automáticamente al inicio se vuelve a pagar entero en cada compactación, no solo una vez al principio.

  7. 07Cuota, límite de tasa y enrutamiento hacia el modelo más barato8 min

    Dos límites distintos gobiernan una sesión, el coste en dinero y el límite de tasa en tokens por minuto, y ambos se tratan con el mismo reflejo: enrutar las tareas repetitivas hacia Haiku o Sonnet, reservar Opus para el razonamiento difícil, y esperar respetando un plazo creciente tras un error 429 en lugar de reintentar de inmediato.