Inicio / Casos reales de principio a fin
Construir un activo de datos, conjunto sintético o base de conocimiento
Un conjunto de datos sintético y una base de conocimiento comparten la misma arquitectura de cuatro operaciones, un esquema común, un identificador de correspondencia, una deduplicación y una validación antes de cualquier uso posterior.
Generar mil ejemplos de entrenamiento sintéticos y constituir una base de conocimiento interna para un agente comparten la misma arquitectura bajo nombres distintos. Ambos pasan por cuatro operaciones comunes: ingesta o generación por lotes, deduplicación, vinculación mediante un esquema compartido, y luego recuperación a través de un índice ligero.
Un esquema antes del primer registro
El esquema fija los campos que lleva cada registro antes de que se cree el primero, tanto si viene de una generación por lotes como de una ingesta de documentos ya existentes. Cada registro lleva también un identificador de correspondencia, estable de una pasada a otra, que permite vincular una entrada nueva con una entrada ya conocida sin depender del contenido del texto en sí.
Deduplicar antes de validar, nunca después
La deduplicación se ejecuta sobre el identificador de correspondencia y sobre una huella del contenido, antes de que nadie relea el lote. Un duplicado no retirado en esta etapa se propaga por toda validación posterior y falsea el recuento final. El ejemplo de abajo fabrica cinco registros ficticios, entre ellos dos duplicados voluntarios, para mostrar la mecánica sin tocar ningún archivo real.
# Datos fabricados aquí mismo, no se toca ningún archivo real
enregistrements = [
{"id": "corr-001", "texte": "lijadora de banda"},
{"id": "corr-002", "texte": "aspirador de taller"},
{"id": "corr-001", "texte": "lijadora de banda"},
{"id": "corr-003", "texte": "amoladora angular"},
{"id": "corr-002", "texte": "aspirador de taller"},
]
vus = set()
uniques = []
for enregistrement in enregistrements:
if enregistrement["id"] not in vus:
vus.add(enregistrement["id"])
uniques.append(enregistrement)
print(len(enregistrements), "registros,", len(uniques), "únicos tras deduplicación")
Cinco entradas fabricadas, tres retenidas tras la deduplicación sobre el identificador: la misma lógica se aplica a quinientas o a cincuenta mil líneas.
Un procesamiento por lotes que cambia el coste, no el método
Cuando la generación o la validación se hace mediante llamadas repetidas a un modelo, agrupar esas llamadas en un procesamiento por lotes en lugar de enviarlas una a una cambia el coste sin cambiar el método. La figura métrica de esta lección cifra esa diferencia. Esta misma disciplina de esquema compartido y de recuperación mediante índice ligero sirve después de base a la búsqueda en abanico, que verifica cada afirmación antes de retenerla.
Las cuatro operaciones comunes a un conjunto sintético y a una base de conocimiento
El coste de un procesamiento por lotes comparado con el procesamiento en tiempo real
Un ingeniero define un esquema común para cada registro, genera quinientas líneas sintéticas que llevan cada una un identificador de correspondencia, y lanza una pasada de deduplicación sobre ese conjunto antes de transmitirlo al equipo que debe validarlo.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: Se ejecutó una etapa de deduplicación sobre el conjunto generado antes de que ese conjunto se transmitiera para su validación.
Lo que esto no establece: Esta situación no establece que la validación llevada a cabo por el equipo receptor haya confirmado la calidad del conjunto de datos.
Los tres calibrados falsos más frecuentes
- Demasiado amplio El conjunto de datos generado está listo para su uso en producción puesto que la deduplicación ya se ha ejecutado.
- Demasiado estrecho Este resultado no prueba nada más que la existencia de un esquema común definido al principio.
- Fuera de tema Esta situación muestra que quinientas líneas es un volumen insuficiente para entrenar un modelo de lenguaje.
- Un conjunto de datos sintético y una base de conocimiento comparten la misma arquitectura de cuatro operaciones, solo cambia el contenido generado o ingerido.
- Cada registro lleva un identificador de correspondencia estable, fijado por el esquema antes de su creación, que permite vincularlo sin depender del texto en sí.
- La deduplicación se ejecuta antes de cualquier validación, nunca después, para no propagar un duplicado en el recuento final.
- Agrupar llamadas a un modelo en un procesamiento por lotes reduce el coste a la mitad respecto al procesamiento en tiempo real, sin cambiar el método de validación.
- Un índice ligero sirve para recuperar un registro preciso, sin recorrer de nuevo el conjunto entero en cada pregunta planteada.
Toma diez líneas de datos que ya utilices, añade a cada una un identificador de correspondencia estable, y localiza a mano los duplicados antes de contarlos.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Anthropic, procesamiento por lotes con la API Messages Batches consultée le 2026-09-02