Accueil / Cas réels de bout en bout
Bâtir un actif de données, jeu synthétique ou base de connaissances
Un jeu de données synthétique et une base de connaissances partagent la même architecture à quatre opérations, un schéma commun, un identifiant de correspondance, une déduplication et une validation avant tout usage en aval.
Générer mille exemples d'entraînement synthétiques et constituer une base de connaissances interne pour un agent partagent la même architecture sous des noms différents. Les deux passent par quatre opérations communes : ingestion ou génération en lot, déduplication, liaison par un schéma partagé, puis rappel via un index léger.
Un schéma avant le premier enregistrement
Le schéma fixe les champs que porte chaque enregistrement avant que le premier ne soit créé, qu'il vienne d'une génération en lot ou d'une ingestion de documents existants. Chaque enregistrement porte aussi un identifiant de correspondance, stable d'une passe à l'autre, qui permet de relier une entrée nouvelle à une entrée déjà connue sans dépendre du contenu du texte lui même.
Dédupliquer avant de valider, jamais après
La déduplication s'exécute sur l'identifiant de correspondance et sur une empreinte du contenu, avant que quiconque ne relise le lot. Un doublon non retiré à ce stade se propage dans toute validation suivante et fausse le compte final. L'exemple ci dessous fabrique cinq enregistrements factices, dont deux doublons volontaires, pour montrer la mécanique sans toucher à un fichier réel.
# Données fabriquées ici même, aucun fichier réel n'est touché
enregistrements = [
{"id": "corr-001", "texte": "ponceuse à bande"},
{"id": "corr-002", "texte": "aspirateur d'atelier"},
{"id": "corr-001", "texte": "ponceuse à bande"},
{"id": "corr-003", "texte": "meuleuse d'angle"},
{"id": "corr-002", "texte": "aspirateur d'atelier"},
]
vus = set()
uniques = []
for enregistrement in enregistrements:
if enregistrement["id"] not in vus:
vus.add(enregistrement["id"])
uniques.append(enregistrement)
print(len(enregistrements), "enregistrements,", len(uniques), "uniques après déduplication")
Cinq entrées fabriquées, trois retenues après déduplication sur l'identifiant : la même logique s'applique à cinq cents ou cinquante mille lignes.
Un traitement par lot qui change le coût, pas la méthode
Quand la génération ou la validation se fait par appels répétés à un modèle, regrouper ces appels dans un traitement par lot plutôt que de les envoyer un par un change le coût sans changer la méthode. La figure métrique de cette leçon chiffre cet écart. Cette même discipline de schéma partagé et de rappel par index léger sert ensuite de socle à la recherche en éventail, qui vérifie chaque affirmation avant de la retenir.
Les quatre opérations communes à un jeu synthétique et à une base de connaissances
Le coût d'un traitement par lot comparé au traitement en temps réel
Un ingénieur définit un schéma commun à chaque enregistrement, génère cinq cents lignes synthétiques portant chacune un identifiant de correspondance, puis lance une passe de déduplication sur cet ensemble avant de le transmettre à l'équipe qui doit le valider.
Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.
Ce que cela établit : Une étape de déduplication a été exécutée sur le jeu généré avant que ce jeu ne soit transmis pour validation.
Ce que cela n’établit pas : Cette situation n'établit pas que la validation menée par l'équipe réceptrice a confirmé la qualité du jeu de données.
Les trois calibrages faux les plus courants
- Trop large Le jeu de données généré est prêt à l'usage en production puisque la déduplication a déjà été exécutée.
- Trop étroit Ce résultat ne prouve rien de plus que l'existence d'un schéma commun défini au départ.
- À côté Cette situation montre que cinq cents lignes est un volume insuffisant pour entraîner un modèle de langage.
- Un jeu de données synthétique et une base de connaissances partagent la même architecture à quatre opérations, seul le contenu généré ou ingéré change.
- Chaque enregistrement porte un identifiant de correspondance stable, fixé par le schéma avant sa création, qui permet de le relier sans dépendre du texte lui même.
- La déduplication s'exécute avant toute validation, jamais après, pour ne pas propager un doublon dans le compte final.
- Regrouper des appels à un modèle dans un traitement par lot réduit le coût de moitié par rapport au traitement en temps réel, sans changer la méthode de validation.
- Un index léger sert au rappel d'un enregistrement précis, sans reparcourir l'ensemble du jeu à chaque question posée.
Prenez dix lignes de données que vous utilisez déjà, ajoutez à chacune un identifiant de correspondance stable, puis repérez à la main les doublons avant de les compter.
Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.
- Anthropic, traitement par lot avec l'API Messages Batches consultée le 2026-09-02