Inicio / Técnicas que cambian el resultado
Verificar un prompt como se verifica un resultado
Un eval es un conjunto de pruebas fijas que puntúa un prompt, y el meta-prompting usa a Claude para mejorar un prompt existente, pero en ambos casos el resultado sigue siendo un borrador que hay que probar, nunca una respuesta definitiva.
Un prompt que respondió bien tres veces seguidas a los ejemplos que probaste no ha sido verificado, solo se ha probado por azar. Un eval cambia esta situación: es un conjunto de casos de prueba fijos, escritos de antemano, que puntúa automáticamente un prompt en cada uno de ellos, exactamente como una batería de pruebas puntúa un programa.
Lo que un eval mide realmente
La documentación de Claude describe este ciclo en una frase clara: construir una aplicación exitosa empieza por definir criterios de éxito, y luego por diseñar evaluaciones que midan el rendimiento respecto a esos criterios, un ciclo central de la ingeniería de prompts (platform.claude.com, sección sobre las pruebas y la evaluación, consultada el 2 de septiembre de 2026). Un eval mínimo cabe en tres líneas.
cas 1 : entree "Le colis est arrive casse" -> attendu "reclamation"
cas 2 : entree "Merci, tout est parfait" -> attendu "compliment"
cas 3 : entree "Quel est le prix du modèle B" -> attendu "question"
Ejecuta tu prompt de clasificación sobre estas tres entradas y compara cada salida obtenida con lo esperado. Una puntuación de dos respuestas correctas de tres no dice que el prompt sea globalmente bueno o malo, dice cuál de los tres casos falla, y es ese el que hay que corregir primero.
El meta-prompting redacta un borrador, no una respuesta
El meta-prompting consiste en pedirle a Claude que mejore un prompt existente en lugar de reescribirlo él solo desde una página en blanco. La herramienta Metaprompt del recetario publicado por Anthropic está pensada para resolver este problema de la página en blanco y dar un punto de partida para iterar, y su documentación lo dice sin rodeos: el prompt obtenido al final no está garantizado óptimo de ninguna manera, no hay que dudar en cambiarlo (cookbook de Anthropic, página Metaprompt, consultada el 2 de septiembre de 2026). Un prompt salido del meta-prompting no tiene, por tanto, más autoridad que un primer borrador escrito a mano, debe pasar por el mismo conjunto de casos fijos antes de ser adoptado.
El mismo conjunto de casos, antes y después
La regla que une las dos mitades de la técnica cabe en una frase: no mejores un prompt sin volver a probarlo después sobre exactamente el mismo conjunto de casos que sirvió para juzgarlo la primera vez. Cambiar los casos de prueba entre los dos pases equivale a comparar dos prompts sobre dos problemas diferentes, lo que no demuestra nada sobre el progreso real. La figura de al lado muestra este ciclo completo. Este principio se une a pon a prueba el verificador antes de creer su veredicto: un eval también es un control, y un control que cambia de casos entre dos mediciones ya no mide lo mismo. Se prolonga directamente en hacer decir varias veces, y contradecirse uno mismo, que aplica otra forma de puesta a prueba, esta vez sobre una sola respuesta en lugar de sobre un prompt entero.
El ciclo eval y meta-prompting, de la primera puntuación a la adopción
Una persona escribe tres casos de prueba fijos para un prompt de clasificación de mensajes de clientes, cada caso asociando una entrada a la categoría esperada. Ejecuta el prompt actual sobre estos tres casos y obtiene dos respuestas correctas de tres. Luego pide a Claude que mejore el prompt a partir de este resultado, y ejecuta el prompt mejorado sobre los mismos tres casos y obtiene tres respuestas correctas de tres.
Escribe en una frase lo que esta situación establece, y en una frase lo que no establece.
Lo que esto establece: Sobre estos tres casos precisos, el prompt mejorado corrige el error que cometía el prompt inicial, pasando de dos respuestas correctas de tres a tres de tres.
Lo que esto no establece: Esto no establece que el prompt mejorado clasifique correctamente mensajes de clientes ausentes de este conjunto de tres casos.
Los tres calibrados falsos más frecuentes
- Demasiado amplio El prompt mejorado clasifica ahora correctamente todos los mensajes de clientes posibles, más allá de estos tres casos probados.
- Demasiado estrecho Este resultado no prueba nada en absoluto, ya que el conjunto de prueba solo contiene tres casos entre todos los mensajes de clientes posibles.
- Fuera de tema Este resultado muestra que Claude es capaz de proponer casos de prueba pertinentes para un prompt de clasificación.
- Un eval es un conjunto de casos de prueba fijos que puntúa automáticamente un prompt, de la misma forma en que una batería de pruebas puntúa un programa entero.
- Una puntuación parcial indica qué caso preciso falló, algo que un juicio global sobre el prompt entero nunca permite detectar por sí solo.
- El meta-prompting produce un punto de partida para retrabajar, nunca un resultado garantizado óptimo, según la propia herramienta que lo produce.
- Un prompt mejorado se vuelve a probar sobre el conjunto de casos exacto que sirvió para juzgarlo al principio, nunca sobre un conjunto diferente.
Escribe tres casos de prueba fijos para un prompt que uses regularmente, entrada y salida esperada para cada uno, ejecuta tu prompt actual sobre ellos, y anota cuántos casos obtienen la respuesta esperada antes de intentar la más mínima mejora.
Estos puntos dependen de una interfaz o de una regla que puede haber cambiado desde la redacción. Verifícalos en tu propia pantalla antes de fiarte de ellos.
- En la página platform.claude.com de las pruebas y evaluaciones, verifica en tu pantalla que el ciclo criterios de éxito y luego evaluación sigue estando descrito ahí, ya que esta documentación fusionó varias páginas en 2026.
Cada afirmación datable de esta lección remite aquí al texto público que la respalda. Una fuente que no se abre no prueba nada.
- Define success criteria and build evaluations consultée le 2026-09-02
- Metaprompt (cookbook de Anthropic) consultée le 2026-09-02