Aller au contenu
Mastering Claude

Accueil / Cas réels de bout en bout

Cas réels de bout en bout8 minApplication

Bâtir un actif de données, jeu synthétique ou base de connaissances

Un jeu de données synthétique et une base de connaissances partagent la même architecture à quatre opérations, un schéma commun, un identifiant de correspondance, une déduplication et une validation avant tout usage en aval.

Générer mille exemples d'entraînement synthétiques et constituer une base de connaissances interne pour un agent partagent la même architecture sous des noms différents. Les deux passent par quatre opérations communes : ingestion ou génération en lot, déduplication, liaison par un schéma partagé, puis rappel via un index léger.

Un schéma avant le premier enregistrement

Le schéma fixe les champs que porte chaque enregistrement avant que le premier ne soit créé, qu'il vienne d'une génération en lot ou d'une ingestion de documents existants. Chaque enregistrement porte aussi un identifiant de correspondance, stable d'une passe à l'autre, qui permet de relier une entrée nouvelle à une entrée déjà connue sans dépendre du contenu du texte lui même.

Dédupliquer avant de valider, jamais après

La déduplication s'exécute sur l'identifiant de correspondance et sur une empreinte du contenu, avant que quiconque ne relise le lot. Un doublon non retiré à ce stade se propage dans toute validation suivante et fausse le compte final. L'exemple ci dessous fabrique cinq enregistrements factices, dont deux doublons volontaires, pour montrer la mécanique sans toucher à un fichier réel.

# Données fabriquées ici même, aucun fichier réel n'est touché
enregistrements = [
    {"id": "corr-001", "texte": "ponceuse à bande"},
    {"id": "corr-002", "texte": "aspirateur d'atelier"},
    {"id": "corr-001", "texte": "ponceuse à bande"},
    {"id": "corr-003", "texte": "meuleuse d'angle"},
    {"id": "corr-002", "texte": "aspirateur d'atelier"},
]

vus = set()
uniques = []
for enregistrement in enregistrements:
    if enregistrement["id"] not in vus:
        vus.add(enregistrement["id"])
        uniques.append(enregistrement)

print(len(enregistrements), "enregistrements,", len(uniques), "uniques après déduplication")

Cinq entrées fabriquées, trois retenues après déduplication sur l'identifiant : la même logique s'applique à cinq cents ou cinquante mille lignes.

Un traitement par lot qui change le coût, pas la méthode

Quand la génération ou la validation se fait par appels répétés à un modèle, regrouper ces appels dans un traitement par lot plutôt que de les envoyer un par un change le coût sans changer la méthode. La figure métrique de cette leçon chiffre cet écart. Cette même discipline de schéma partagé et de rappel par index léger sert ensuite de socle à la recherche en éventail, qui vérifie chaque affirmation avant de la retenir.

Figure 1

Les quatre opérations communes à un jeu synthétique et à une base de connaissances

01
Ingestion ou génération en lot
Les enregistrements arrivent d'une source existante ou sont générés par lot, chacun avec un identifiant de correspondance dès sa création.
02
Déduplication
Les doublons sont retirés sur l'identifiant et sur une empreinte du contenu, avant toute relecture humaine.
03
Liaison par schéma partagé
Chaque enregistrement respecte le même schéma, ce qui permet de le relier à d'autres enregistrements sans dépendre du contenu du texte.
04
Rappel via un index léger
Un index de taille réduite permet de retrouver un enregistrement précis sans reparcourir l'ensemble du jeu à chaque question.
La séquence montre l'ordre dans lequel les quatre opérations s'enchaînent, de l'ingestion ou de la génération en lot jusqu'au rappel par un index léger.
Figure 2

Le coût d'un traitement par lot comparé au traitement en temps réel

50pour cent
réduction du coût d'un traitement par lot via l'API Messages Batches, par rapport au traitement en temps réel
platform.claude.com/docs/en/build-with-claude/batch-processing, 2026-09-02
Le chiffre borne l'écart de coût entre un traitement par lot et un traitement en temps réel sur l'API Claude, mesuré sur la documentation officielle du traitement par lot.
Calibrez vous-même

Un ingénieur définit un schéma commun à chaque enregistrement, génère cinq cents lignes synthétiques portant chacune un identifiant de correspondance, puis lance une passe de déduplication sur cet ensemble avant de le transmettre à l'équipe qui doit le valider.

Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.

Ce qu’il faut retenir
  • Un jeu de données synthétique et une base de connaissances partagent la même architecture à quatre opérations, seul le contenu généré ou ingéré change.
  • Chaque enregistrement porte un identifiant de correspondance stable, fixé par le schéma avant sa création, qui permet de le relier sans dépendre du texte lui même.
  • La déduplication s'exécute avant toute validation, jamais après, pour ne pas propager un doublon dans le compte final.
  • Regrouper des appels à un modèle dans un traitement par lot réduit le coût de moitié par rapport au traitement en temps réel, sans changer la méthode de validation.
  • Un index léger sert au rappel d'un enregistrement précis, sans reparcourir l'ensemble du jeu à chaque question posée.
À faire maintenant

Prenez dix lignes de données que vous utilisez déjà, ajoutez à chacune un identifiant de correspondance stable, puis repérez à la main les doublons avant de les compter.

Vérifier à la source

Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.