Accueil / Techniques qui changent le résultat
Vérifier un prompt comme on vérifie un résultat
Un eval est un jeu de tests fixes qui note un prompt, et le meta-prompting utilise Claude pour améliorer un prompt existant, mais dans les deux cas le résultat reste un brouillon à tester, jamais une réponse définitive.
Un prompt qui a répondu juste trois fois de suite aux exemples que vous avez essayés n'a pas été vérifié, il a seulement été essayé par hasard. Un eval change cette situation : c'est un jeu de cas de test fixes, écrits à l'avance, qui note automatiquement un prompt sur chacun d'eux, exactement comme une suite de tests note un programme.
Ce qu'un eval mesure réellement
La documentation de Claude décrit ce cycle en une phrase claire : construire une application réussie commence par définir des critères de succès, puis par concevoir des évaluations qui mesurent la performance par rapport à ces critères, un cycle central de l'ingénierie de prompt (platform.claude.com, section sur les tests et l'évaluation, consultée le 2 septembre 2026). Un eval minimal tient en trois lignes.
cas 1 : entree "Le colis est arrive casse" -> attendu "reclamation"
cas 2 : entree "Merci, tout est parfait" -> attendu "compliment"
cas 3 : entree "Quel est le prix du modèle B" -> attendu "question"
Faites tourner votre prompt de classement sur ces trois entrées et comparez chaque sortie obtenue à l'attendu. Un score de deux réponses justes sur trois ne dit pas que le prompt est globalement bon ou mauvais, il dit lequel des trois cas échoue, et c'est celui là qu'il faut corriger en premier.
Le meta-prompting rédige un brouillon, pas une réponse
Le meta-prompting consiste à demander à Claude d'améliorer un prompt existant plutôt que de le réécrire seul depuis une page blanche. L'outil Metaprompt du recueil de recettes publié par Anthropic est conçu pour résoudre ce problème de la page blanche et donner un point de départ pour itérer, et sa documentation le dit sans détour : le prompt obtenu à la fin n'est garanti optimal en aucune façon, il ne faut pas hésiter à le changer (cookbook Anthropic, page Metaprompt, consultée le 2 septembre 2026). Un prompt sorti du meta-prompting n'a donc pas plus d'autorité qu'un premier brouillon écrit à la main, il doit passer par le même jeu de cas fixes avant d'être adopté.
Le même jeu de cas, avant et après
La règle qui relie les deux moitiés de la technique tient en une phrase : n'améliorez pas un prompt sans le retester ensuite sur exactement le même jeu de cas que celui qui a servi à le juger la première fois. Changer les cas de test entre les deux passes revient à comparer deux prompts sur deux problèmes différents, ce qui ne prouve rien sur le progrès réel. La figure ci contre montre ce cycle complet. Ce principe rejoint testez le vérificateur avant de croire son verdict : un eval est lui aussi un contrôle, et un contrôle qui change de cas entre deux mesures ne mesure plus la même chose. Il se prolonge directement dans faire dire plusieurs fois, et se contredire soi même, qui applique une autre forme de mise à l'épreuve, cette fois sur une seule réponse plutôt que sur un prompt entier.
Le cycle eval et meta-prompting, du premier score à l'adoption
Une personne écrit trois cas de test fixes pour un prompt de classification de messages clients, chaque cas associant une entrée à la catégorie attendue. Elle fait tourner le prompt actuel sur ces trois cas et obtient deux réponses correctes sur trois. Elle demande ensuite à Claude d'améliorer le prompt à partir de ce résultat, puis fait tourner le prompt amélioré sur les trois mêmes cas et obtient trois réponses correctes sur trois.
Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.
Ce que cela établit : Sur ces trois cas précis, le prompt amélioré corrige l'erreur que le prompt initial commettait, passant de deux réponses correctes sur trois à trois sur trois.
Ce que cela n’établit pas : Cela n'établit pas que le prompt amélioré classe correctement des messages clients absents de ce jeu de trois cas.
Les trois calibrages faux les plus courants
- Trop large Le prompt amélioré classe désormais correctement tous les messages clients possibles, au delà de ces trois cas testés.
- Trop étroit Ce résultat ne prouve rien du tout, puisque le jeu de test ne contient que trois cas parmi tous les messages clients possibles.
- À côté Ce résultat montre que Claude est capable de proposer des cas de test pertinents pour un prompt de classification.
- Un eval est un jeu de cas de test fixes qui note automatiquement un prompt, à la façon dont une suite de tests note un programme entier.
- Un score partiel indique quel cas précis a échoué, ce qu'un jugement global sur le prompt entier ne permet jamais de repérer seul.
- Le meta-prompting produit un point de départ à retravailler, jamais un résultat garanti optimal, selon l'outil qui le produit lui même.
- Un prompt amélioré se reteste sur le jeu de cas exact qui a servi à le juger au départ, jamais sur un jeu différent.
Écrivez trois cas de test fixes pour un prompt que vous utilisez régulièrement, entrée et sortie attendue pour chacun, faites tourner votre prompt actuel dessus, et notez combien de cas obtiennent la réponse attendue avant de tenter la moindre amélioration.
Ces points dépendent d’une interface ou d’une règle qui peut avoir changé depuis la rédaction. Vérifiez-les sur votre propre écran avant de vous y fier.
- Sur la page platform.claude.com des tests et évaluations, vérifiez sur votre écran que le cycle critères de succès puis évaluation y est toujours décrit, cette documentation ayant déjà fusionné plusieurs pages en 2026.
Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.
- Define success criteria and build evaluations consultée le 2026-09-02
- Metaprompt (cookbook Anthropic) consultée le 2026-09-02