Ir al contenido
Mastering Claude

Inicio / Casos reales de principio a fin

Casos reales de principio a fin8 minApplication

Construir un activo de datos, conjunto sintético o base de conocimiento

Un conjunto de datos sintético y una base de conocimiento comparten la misma arquitectura de cuatro operaciones, un esquema común, un identificador de correspondencia, una deduplicación y una validación antes de cualquier uso posterior.

Generar mil ejemplos de entrenamiento sintéticos y constituir una base de conocimiento interna para un agente comparten la misma arquitectura bajo nombres distintos. Ambos pasan por cuatro operaciones comunes: ingesta o generación por lotes, deduplicación, vinculación mediante un esquema compartido, y luego recuperación a través de un índice ligero.

Un esquema antes del primer registro

El esquema fija los campos que lleva cada registro antes de que se cree el primero, tanto si viene de una generación por lotes como de una ingesta de documentos ya existentes. Cada registro lleva también un identificador de correspondencia, estable de una pasada a otra, que permite vincular una entrada nueva con una entrada ya conocida sin depender del contenido del texto en sí.

Deduplicar antes de validar, nunca después

La deduplicación se ejecuta sobre el identificador de correspondencia y sobre una huella del contenido, antes de que nadie relea el lote. Un duplicado no retirado en esta etapa se propaga por toda validación posterior y falsea el recuento final. El ejemplo de abajo fabrica cinco registros ficticios, entre ellos dos duplicados voluntarios, para mostrar la mecánica sin tocar ningún archivo real.

# Datos fabricados aquí mismo, no se toca ningún archivo real
enregistrements = [
    {"id": "corr-001", "texte": "lijadora de banda"},
    {"id": "corr-002", "texte": "aspirador de taller"},
    {"id": "corr-001", "texte": "lijadora de banda"},
    {"id": "corr-003", "texte": "amoladora angular"},
    {"id": "corr-002", "texte": "aspirador de taller"},
]

vus = set()
uniques = []
for enregistrement in enregistrements:
    if enregistrement["id"] not in vus:
        vus.add(enregistrement["id"])
        uniques.append(enregistrement)

print(len(enregistrements), "registros,", len(uniques), "únicos tras deduplicación")

Cinco entradas fabricadas, tres retenidas tras la deduplicación sobre el identificador: la misma lógica se aplica a quinientas o a cincuenta mil líneas.

Un procesamiento por lotes que cambia el coste, no el método

Cuando la generación o la validación se hace mediante llamadas repetidas a un modelo, agrupar esas llamadas en un procesamiento por lotes en lugar de enviarlas una a una cambia el coste sin cambiar el método. La figura métrica de esta lección cifra esa diferencia. Esta misma disciplina de esquema compartido y de recuperación mediante índice ligero sirve después de base a la búsqueda en abanico, que verifica cada afirmación antes de retenerla.

Figure 1

Las cuatro operaciones comunes a un conjunto sintético y a una base de conocimiento

01
Ingesta o generación por lotes
Los registros llegan de una fuente existente o se generan por lotes, cada uno con un identificador de correspondencia desde su creación.
02
Deduplicación
Los duplicados se retiran según el identificador y una huella del contenido, antes de cualquier relectura humana.
03
Vinculación mediante esquema compartido
Cada registro respeta el mismo esquema, lo que permite vincularlo con otros registros sin depender del contenido del texto.
04
Recuperación mediante índice ligero
Un índice de tamaño reducido permite encontrar un registro preciso sin recorrer de nuevo el conjunto entero en cada pregunta.
La secuencia muestra el orden en que se encadenan las cuatro operaciones, desde la ingesta o la generación por lotes hasta la recuperación mediante un índice ligero.
Figure 2

El coste de un procesamiento por lotes comparado con el procesamiento en tiempo real

50por ciento
reducción del coste de un procesamiento por lotes mediante la API Messages Batches, respecto al procesamiento en tiempo real
platform.claude.com/docs/en/build-with-claude/batch-processing, 2026-09-02
La cifra acota la diferencia de coste entre un procesamiento por lotes y un procesamiento en tiempo real en la API de Claude, medida en la documentación oficial del procesamiento por lotes.
Calíbralo tú mismo

Un ingeniero define un esquema común para cada registro, genera quinientas líneas sintéticas que llevan cada una un identificador de correspondencia, y lanza una pasada de deduplicación sobre ese conjunto antes de transmitirlo al equipo que debe validarlo.

Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.

Lo que hay que recordar
  • Un conjunto de datos sintético y una base de conocimiento comparten la misma arquitectura de cuatro operaciones, solo cambia el contenido generado o ingerido.
  • Cada registro lleva un identificador de correspondencia estable, fijado por el esquema antes de su creación, que permite vincularlo sin depender del texto en sí.
  • La deduplicación se ejecuta antes de cualquier validación, nunca después, para no propagar un duplicado en el recuento final.
  • Agrupar llamadas a un modelo en un procesamiento por lotes reduce el coste a la mitad respecto al procesamiento en tiempo real, sin cambiar el método de validación.
  • Un índice ligero sirve para recuperar un registro preciso, sin recorrer de nuevo el conjunto entero en cada pregunta planteada.
Hazlo ahora

Toma diez líneas de datos que ya utilices, añade a cada una un identificador de correspondencia estable, y localiza a mano los duplicados antes de contarlos.

Verificar en la fuente

Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.