Ir al contenido
Mastering Claude

Inicio / Varios agentes y verificación adversa

Varios agentes y verificación adversa8 minApplication

Multiplicar los agentes puede multiplicar el error

Un estudio que pone a prueba cinco arquitecturas de agentes en 260 configuraciones mide una tasa de error amplificada hasta unas diecisiete veces la de un agente solo cuando agentes independientes trabajan sin un coordinador que valide sus salidas, frente a unas cuatro veces cuando un coordinador las valida, y en una tarea estrictamente secuencial, las cuatro arquitecturas multiagente probadas retroceden todas frente a un agente solo.

Un estudio publicado en arXiv en diciembre de 2025, actualizado en abril de 2026, puso a prueba cinco arquitecturas de agentes en 260 configuraciones, seis bancos de pruebas y tres familias de modelos distintas. Mide una tasa de amplificación de errores al nivel de la traza de ejecución, denotada A traza en el estudio, que compara el número de errores producidos por un sistema con varios agentes con el número de errores de un agente solo en la misma tarea; esta cifra figura en la tabla 5 del texto completo, no solo en la página de resumen. Cuando agentes independientes trabajan cada uno en su parte sin un coordinador que valide sus salidas, esta tasa alcanza unas diecisiete veces la de un agente solo.

El coordinador que valida lo cambia todo

El mismo estudio mide una amplificación mucho menor, unas cuatro veces, para la arquitectura centralizada, donde un coordinador relee y valida las salidas de cada agente antes de hacerlas subir. Los autores explican esta diferencia por un cuello de botella deliberado: el coordinador actúa como un punto de paso obligado que puede interceptar un error antes de que se propague. La arquitectura independiente, en cambio, no dispone de ningún punto equivalente, cada agente produce su resultado sin tener nunca la ocasión de confrontarlo con el de otro.

Estudio, 260 configuraciones, seis bancos de pruebas, tres familias de modelos
Arquitectura independiente, sin coordinador que valide: A traza = 17,2
Arquitectura centralizada, coordinador que valide: A traza = 4,4
Tarea secuencial estricta (PlanCraft): las cuatro arquitecturas
multiagente retroceden todas frente al agente solo, de -39 a -70 por ciento

Una tarea secuencial estricta iguala a todos por abajo

En una tarea que impone un orden estricto de pasos, llamada PlanCraft en el estudio, las cuatro arquitecturas con varios agentes probadas retroceden todas frente a un agente solo, entre 39 y 70 por ciento según la arquitectura elegida. Añadir agentes no mejora entonces mecánicamente un resultado: en este tipo de tarea, ocurre lo contrario, sea cual sea la forma en que los agentes estén organizados entre sí.

Este estudio sigue siendo, en el momento de redactar este curso, una prepublicación en arXiv, en su tercera versión pública: no se ha encontrado en el texto mismo ninguna mención de una publicación final en una revista con revisión por pares, así que este punto queda por verificar en vez de afirmarse. La lección anterior detalla lo que un verificador adverso debe recibir para juzgar un trabajo; la lección siguiente muestra otro lugar donde varios agentes multiplican una misma debilidad en vez de corregirla, una afirmación falsa deslizada en el encuadre dado a cada uno de ellos.

Figure 1

Dos arquitecturas, dos niveles de amplificación del error

17,2veces
Amplificación del error, en múltiplo de un agente solo, para la arquitectura independiente, donde ningún coordinador valida las salidas antes de hacerlas subir.
Kim et al., arXiv 2512.08296, 2026-04-08
4,4veces
Amplificación del error, en múltiplo de un agente solo, para la arquitectura centralizada, donde un coordinador valida cada salida antes de que se transmita.
Kim et al., arXiv 2512.08296, 2026-04-08
-70por ciento
Retroceso frente a un agente solo en una tarea de planificación secuencial, la mayor caída de las arquitecturas probadas.
Kim et al., arXiv 2512.08296, 2026-04-08
Los tres valores vienen del mismo estudio: un coordinador que valida reduce claramente la amplificación del error, y en una tarea estrictamente secuencial, añadir agentes empeora el resultado en vez de mejorarlo.
Calíbralo tú mismo

Un desarrollador lanza cuatro agentes independientes, cada uno encargado de analizar un registro de errores distinto de la misma aplicación, y prevé pegar los cuatro informes uno tras otro en el documento final.

Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.

Lo que hay que recordar
  • Un estudio que pone a prueba cinco arquitecturas en 260 configuraciones mide una tasa de error multiplicada por unas diecisiete veces cuando agentes independientes trabajan sin un coordinador que valide sus salidas.
  • Un coordinador que valida los resultados antes de hacerlos subir reduce esta amplificación a unas cuatro veces la de un agente solo, sin anularla por completo.
  • En una tarea estrictamente secuencial, las cuatro arquitecturas multiagente probadas rinden todas peor que un agente solo, lo que descarta la idea de que añadir agentes mejora sistemáticamente un resultado.
  • La amplificación viene de la falta de ocasión de corrección entre agentes independientes, no de un defecto propio de un modelo de lenguaje concreto, ya que el estudio abarcó tres familias distintas.
  • Este estudio sigue siendo una prepublicación en arXiv en el momento de redactar este curso, sin confirmación encontrada de una publicación final en una revista con revisión por pares.
Hazlo ahora

Antes de tu próximo fan-out sobre un tema donde varios agentes cubren el mismo terreno, prevé una etapa de comparación lado a lado que lleves tú mismo, nunca confiada a los propios agentes.

Lo que queda por verificar

Estos puntos dependen de una interfaz o de una regla que puede haber cambiado desde la redacción. Verifícalos en tu propia pantalla antes de fiarte de ellos.

  • Los valores 17,2 y 4,4 no figuran en la página de resumen de arXiv, solo en la tabla 5 del texto completo en PDF: abre el PDF en vez de solo la página de resumen para verificarlos. Consulta también si se ha publicado una versión más reciente que la v3 de abril de 2026, o si el estudio ya ha aparecido en una revista con revisión por pares.
Verificar en la fuente

Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.