Aller au contenu
Mastering Claude

Accueil / Plusieurs agents et vérification adverse

Plusieurs agents et vérification adverse8 minApplication

Multiplier les agents peut multiplier l'erreur

Une étude testant cinq architectures d'agents sur 260 configurations mesure un taux d'erreur amplifié jusqu'à environ dix-sept fois celui d'un agent seul quand des agents indépendants travaillent sans coordinateur qui valide leurs sorties, contre environ quatre fois quand un coordinateur les valide, et sur une tâche strictement séquentielle, les quatre architectures multi-agents testées reculent toutes face à un agent seul.

Une étude publiée sur arXiv en décembre 2025, mise à jour en avril 2026, a testé cinq architectures d'agents sur 260 configurations, six bancs d'essai et trois familles de modèles différentes. Elle mesure un taux d'amplification des erreurs au niveau de la trace d'exécution, noté A trace dans l'étude, qui compare le nombre d'erreurs produites par un système à plusieurs agents au nombre d'erreurs d'un agent seul sur la même tâche ; ce chiffre figure dans le tableau 5 du texte complet, pas sur la seule page de résumé. Quand des agents indépendants travaillent chacun sur sa part sans coordinateur qui valide leurs sorties, ce taux atteint environ dix-sept fois celui d'un agent seul.

Le coordinateur qui valide change tout

La même étude mesure une amplification bien plus faible, environ quatre fois, pour l'architecture centralisée, où un coordinateur relit et valide les sorties de chaque agent avant de les faire remonter. Les auteurs expliquent cet écart par un goulot d'étranglement volontaire : le coordinateur agit comme un point de passage obligé qui peut intercepter une erreur avant qu'elle ne se propage. L'architecture indépendante, elle, ne dispose d'aucun point équivalent, chaque agent produit son résultat sans jamais avoir l'occasion de le confronter à celui d'un autre.

Etude, 260 configurations, six bancs d'essai, trois familles de modeles
Architecture independante, sans coordinateur qui valide : A trace = 17,2
Architecture centralisee, coordinateur qui valide : A trace = 4,4
Tache sequentielle stricte (PlanCraft) : les quatre architectures
multi agents reculent toutes face a l'agent seul, de -39 a -70 pour cent

Une tâche séquentielle stricte égalise tout le monde vers le bas

Sur une tâche qui impose un ordre strict d'étapes, nommée PlanCraft dans l'étude, les quatre architectures à plusieurs agents testées reculent toutes par rapport à un agent seul, entre 39 et 70 pour cent selon l'architecture choisie. Ajouter des agents n'améliore donc pas mécaniquement un résultat : sur ce type de tâche, c'est l'inverse qui se produit, quelle que soit la façon dont les agents sont organisés entre eux.

Cette étude reste, au moment de la rédaction de ce cours, une prépublication arXiv, à sa troisième version publique : aucune mention d'une publication finale dans une revue à comité de lecture n'a été trouvée dans le texte lui même, ce point reste donc à vérifier plutôt qu'à affirmer. La leçon précédente détaille ce qu'un vérificateur adverse doit recevoir pour juger un travail ; la leçon suivante montre un autre endroit où plusieurs agents multiplient une même faiblesse plutôt que de la corriger, une affirmation fausse glissée dans le cadrage donné à chacun d'eux.

Figure 1

Deux architectures, deux niveaux d'amplification de l'erreur

17,2fois
Amplification de l'erreur, en multiple d'un agent seul, pour l'architecture indépendante, où aucun coordinateur ne valide les sorties avant de les faire remonter.
Kim et al., arXiv 2512.08296, 2026-04-08
4,4fois
Amplification de l'erreur, en multiple d'un agent seul, pour l'architecture centralisée, où un coordinateur valide chaque sortie avant qu'elle ne soit transmise.
Kim et al., arXiv 2512.08296, 2026-04-08
-70pour cent
Recul face à un agent seul sur une tâche de planification séquentielle, la plus forte baisse des architectures testées.
Kim et al., arXiv 2512.08296, 2026-04-08
Les trois valeurs viennent de la même étude : un coordinateur qui valide réduit nettement l'amplification de l'erreur, et sur une tâche strictement séquentielle, ajouter des agents dégrade le résultat au lieu de l'améliorer.
Calibrez vous-même

Un développeur lance quatre agents indépendants, chacun chargé d'analyser un journal d'erreurs distinct de la même application, et prévoit de coller les quatre rapports bout à bout dans le document final.

Écrivez en une phrase ce que cette situation établit, et en une phrase ce qu'elle n'établit pas.

Ce qu’il faut retenir
  • Une étude testant cinq architectures sur 260 configurations mesure un taux d'erreur multiplié par environ dix-sept lorsque des agents indépendants travaillent sans coordinateur qui valide leurs sorties.
  • Un coordinateur qui valide les résultats avant de les faire remonter réduit cette amplification à environ quatre fois celle d'un agent seul, sans l'annuler complètement.
  • Sur une tâche strictement séquentielle, les quatre architectures multi-agents testées font toutes moins bien qu'un agent seul, ce qui écarte l'idée qu'ajouter des agents améliore systématiquement un résultat.
  • L'amplification vient de l'absence d'occasion de correction entre agents indépendants, pas d'un défaut propre à un modèle de langage précis, l'étude ayant porté sur trois familles différentes.
  • Cette étude reste une prépublication arXiv au moment de la rédaction de ce cours, sans confirmation trouvée d'une publication finale dans une revue à comité de lecture.
À faire maintenant

Avant votre prochain fan-out sur un sujet où plusieurs agents couvrent le même terrain, prévoyez une étape de comparaison côte à côte que vous menez vous-même, jamais confiée aux agents eux-mêmes.

Ce qui reste à vérifier

Ces points dépendent d’une interface ou d’une règle qui peut avoir changé depuis la rédaction. Vérifiez-les sur votre propre écran avant de vous y fier.

  • Les valeurs 17,2 et 4,4 ne figurent pas sur la page de résumé arXiv, seulement dans le tableau 5 du texte complet en PDF : ouvrez le PDF plutôt que la seule page de résumé pour les vérifier. Consultez aussi si une version plus récente que la v3 d'avril 2026 a été publiée, ou si l'étude est depuis parue dans une revue à comité de lecture.
Vérifier à la source

Chaque affirmation datable de cette leçon renvoie ici au texte public qui la porte. Une source qui ne s’ouvre pas ne prouve rien.