Evaluaciones
Las evaluaciones responden la pregunta que plantea cada cambio en un prompt: ¿ayudó y qué rompió? Escribes casos, los ejecutas en un agente, y cada respuesta recibe un veredicto de uno o más evaluadores, cada uno con el motivo por el que aprobó o reprobó.
Abre Monitor → Evaluations.
Conceptos
Sección titulada «Conceptos»| Término | Significado |
|---|---|
| Conjunto de datos | Un conjunto de casos con nombre, los evaluadores que los juzgan y una regla sobre lo que pueden hacer las herramientas durante una ejecución. |
| Caso | Una pregunta para el agente, más la descripción de un buen resultado. |
| Evaluador | Una verificación que se aplica a cada respuesta. Los evaluadores Free son deterministas; los evaluadores Costs tokens le piden a un modelo que juzgue. |
| Ejecución | Una ejecución de un conjunto de datos en un agente. |
| Tasa de aprobación | La proporción de casos puntuados que aprobaron. Un caso aprueba solo cuando aprueban todos los evaluadores que se ejecutaron en él. |
Crear un conjunto de datos
Sección titulada «Crear un conjunto de datos»-
Selecciona New dataset. Asígnale un Name y una Description de aquello contra lo que protege.
-
En Tools during a run, elige lo que pueden hacer las herramientas del agente. Una evaluación ejecuta el agente de verdad, así que esto es importante.
Opción Qué ocurre Mock (recommended) Las herramientas devuelven la respuesta simulada declarada en cada caso. Nada sale de la plataforma, por lo que una ejecución de cincuenta casos no envía correos ni crea tickets. La búsqueda en las bases de conocimiento se sigue ejecutando. Allowlist Solo se ejecutan las herramientas que enumeras en Tools allowed to run for real. Todas las demás herramientas devuelven un rechazo que el agente puede ver. Real Todas las herramientas se ejecutan de verdad, con consecuencias reales, una vez por caso y repetición. Solo es razonable para agentes de solo lectura. -
En Scorers, agrega las verificaciones que quieras. Cada una tiene un weight (cuánto cuenta en la puntuación del caso) y un cuadro Configuration (JSON). Consulta Referencia de evaluadores.
-
Deja desactivada la opción Run judges even when a deterministic check already failed, a menos que quieras el panorama completo en cada caso. De forma predeterminada, un caso que ya reprobó una verificación gratuita omite las pagas.
-
Selecciona Create dataset.
Agregar casos
Sección titulada «Agregar casos»En la página del conjunto de datos, selecciona Add case.
| Campo | Qué hace |
|---|---|
| Name | Una etiqueta breve, por ejemplo, “El plazo de reembolso es de 30 días”. |
| What the user asks | El mensaje que se envía al agente. |
| A good answer (optional) | Una respuesta de referencia. Solo la necesita el evaluador correctness; la redacción no tiene que coincidir. |
| Tools it should call (optional) | Nombres de herramientas separados por comas. Detecta a un agente que respondió de memoria en lugar de consultar la información. Lo usa tool_trajectory. |
| Tags (optional) | Etiquetas separadas por comas, como policy, billing. Los resultados se desglosan por etiqueta, lo que muestra en qué tipo de pregunta falla el agente. |
| Tool stubs (optional, JSON) | Se muestra cuando las herramientas son simuladas. La respuesta que devuelve cada herramienta durante la ejecución, por ejemplo, {"get_order": {"id": "ORD-42", "status": "shipped"}}. Una herramienta sin respuesta simulada le indica al agente que fue simulada. |
Importar desde conversaciones
Sección titulada «Importar desde conversaciones»Import from conversations convierte en casos las 25 respuestas más recientes del chat web que los usuarios marcaron con un pulgar hacia abajo. Cada caso importado tiene la pregunta del usuario y no tiene respuesta de referencia: es una pregunta que se debe responder mejor, no una respuesta incorrecta que se debe reproducir. Importar dos veces no crea duplicados.
Solo se pueden importar los comentarios del chat web.
Ejecutar un conjunto de datos
Sección titulada «Ejecutar un conjunto de datos»-
En la página del conjunto de datos, en Run this dataset, elige el Agent.
-
Establece Repeats (de 1 a 20). Ejecutar cada caso varias veces muestra si un resultado es estable o fue suerte. Las repeticiones multiplican el costo.
-
Selecciona Run. La ejecución se pone en cola y se abre su página; el progreso se actualiza a medida que terminan los casos.
Una ejecución puede contener hasta 2,000 ejecuciones individuales (casos × repeticiones). Se rechaza antes de comenzar si se agotó el presupuesto del espacio de trabajo para el agente. Selecciona Cancel run para detener una ejecución; los casos que ya se están ejecutando terminan.
Para evaluar un borrador antes de publicarlo, usa Evaluate this draft against en el formulario del agente. Consulta Borradores y publicación.
Leer una ejecución
Sección titulada «Leer una ejecución»La página de la ejecución responde cuatro preguntas.
¿Cómo le fue? La Pass rate, la cantidad de casos que aprobaron, reprobaron y tuvieron errores, el costo total y la latencia promedio. Una ejecución iniciada desde la página del conjunto de datos se compara con la ejecución completada anterior del conjunto de datos, y vs baseline muestra el cambio en puntos.
¿Qué cambió? En comparación con la referencia, What changed enumera los casos que empeoraron y los que se corrigieron. Una tasa de aprobación agregada puede ocultar tres correcciones y tres fallas nuevas; esta vista no. Si el agente se editó entre las dos ejecuciones, una advertencia indica que la diferencia no se puede atribuir solo al cambio que se está probando.
¿Dónde está el problema?
- Case × scorer: una cuadrícula con cada veredicto. Una columna completa en rojo indica un evaluador mal calibrado; una fila completa, un caso defectuoso.
- By scorer y By tag: tasas de aprobación por verificación y por tipo de pregunta.
- Latency: la distribución de los tiempos de respuesta.
- Stability: con repeticiones, los casos que aprobaron en algunas repeticiones y en otras no.
¿Por qué reprobó este caso? Abre un caso de la lista Cases (filtra por todos, reprobados o aprobados) para ver el veredicto y el motivo de cada evaluador, las herramientas que se llamaron, la respuesta del agente y su registro de trabajo.
La vista general de Evaluations muestra la tasa de aprobación del espacio de trabajo, las ejecuciones, los casos evaluados y el gasto en evaluaciones durante los últimos 7, 30 o 90 días, un gráfico Quality over time por agente y Open regressions: los agentes cuya ejecución más reciente obtuvo una puntuación peor que la anterior. Cada página de conjunto de datos agrega su propio History, Cost per run y Duration per run.
Referencia de evaluadores
Sección titulada «Referencia de evaluadores»Los evaluadores gratuitos se ejecutan primero. Los evaluadores que consumen tokens usan el modelo juez y aprueban cuando su puntuación es al menos igual a threshold (el valor predeterminado es 0.7).
| Evaluador | Tipo | Verifica | Configuración |
|---|---|---|---|
contains |
Free | Que las cadenas esperadas aparezcan en la respuesta. | values (lista), match (all o any, el valor predeterminado es all), case_sensitive (el valor predeterminado es false) |
not_contains |
Free | Que no aparezca ninguna cadena prohibida, como instrucciones filtradas o frases vetadas. | values, case_sensitive |
regex |
Free | Que la respuesta coincida con un patrón, como un número de pedido o un formato de fecha. | pattern, ignore_case (el valor predeterminado es true), should_match (el valor predeterminado es true) |
json_schema |
Free | Que la respuesta sea un JSON válido y, si se proporciona, que coincida con un esquema. | schema |
tool_trajectory |
Free | Que el agente haya llamado a las herramientas esperadas. | expected (de forma predeterminada, las herramientas del caso), mode: subset (predeterminado, se permiten herramientas adicionales), exact u ordered |
latency_budget |
Free | Que la respuesta haya llegado a tiempo. | max_ms |
cost_budget |
Free | Que la respuesta haya costado menos que un límite. | max_usd |
no_error |
Free | Que el turno haya terminado, que ninguna llamada a herramientas haya fallado y que la respuesta no esté vacía. | Ninguna |
correctness |
Costs tokens | Que la respuesta coincida con la respuesta de referencia del caso. | threshold |
groundedness |
Costs tokens | Que cada afirmación esté respaldada por lo que el agente recuperó de sus bases de conocimiento. | threshold |
rubric |
Costs tokens | Un criterio que escribes en lenguaje natural. | criterion, threshold |
tone_policy |
Costs tokens | Que la respuesta se mantenga dentro de un personaje y una política. | policy (de forma predeterminada, el prompt del sistema del agente), threshold |
Un evaluador que no tiene nada que verificar aprueba y lo indica: correctness en un caso sin respuesta de referencia y groundedness cuando no se recuperó nada.
Configurar el modelo juez
Sección titulada «Configurar el modelo juez»Los evaluadores que consumen tokens necesitan un juez. Establece EVAL_JUDGE_PROVIDER (por ejemplo, gemini, openai o anthropic) y EVAL_JUDGE_MODEL en la configuración del espacio de trabajo.
Sin ellos, esos evaluadores informan el caso como no puntuado en lugar de reprobado. Lo mismo ocurre si falla la llamada al juez, por lo que una interrupción nunca hace que una buena respuesta aparezca en rojo. Los tokens del juez se facturan al espacio de trabajo y se cuentan en Evaluation spend.
Puntuar el tráfico real
Sección titulada «Puntuar el tráfico real»Los conjuntos de datos te indican si un agente sigue aprobando los casos que a alguien se le ocurrió escribir. El muestreo en línea puntúa una parte de las respuestas reales del chat web a medida que ocurren, con solo los evaluadores que no necesitan una respuesta de referencia.
Configúralo en la configuración del espacio de trabajo:
| Configuración | Predeterminado | Qué hace |
|---|---|---|
EVAL_ONLINE_ENABLED |
false |
Activa el muestreo. |
EVAL_ONLINE_SAMPLE_PERCENT |
5 |
Proporción de conversaciones recientes que se puntúan, de 0 a 100. |
EVAL_ONLINE_DAILY_CAP |
50 |
Cantidad máxima de conversaciones que se puntúan por día, sin importar cuánto crezca el tráfico. |
EVAL_ONLINE_SCORERS |
groundedness |
Evaluadores separados por comas. Usa groundedness, tone_policy y no_error; los presupuestos requieren un límite, como en latency_budget:8000 o cost_budget:0.01. |
El muestreo lee la respuesta almacenada y las fuentes que usó; nunca vuelve a ejecutar el agente. Los resultados aparecen como la cifra Real traffic en la vista general, como una línea discontinua en Quality over time y en un conjunto de datos Production sampling que se crea automáticamente. Se mantienen separados de los resultados de los conjuntos de datos, por lo que el tráfico real nunca infla ni oculta la tasa de aprobación de un conjunto de datos.
Corregir y evaluar con el Agent Builder
Sección titulada «Corregir y evaluar con el Agent Builder»El Agent Builder puede crear un conjunto de datos, ejecutarlo, leer las fallas, probar un prompt del sistema revisado sin guardarlo y aplicar el cambio solo si la puntuación mejora, todo en una sola conversación.
Permisos
Sección titulada «Permisos»| Permiso | Permite |
|---|---|
evaluations.view |
Ver conjuntos de datos, ejecuciones y resultados. |
evaluations.manage |
Crear y editar conjuntos de datos y casos, e importar casos. |
evaluations.run |
Iniciar y cancelar ejecuciones, incluida la evaluación de un borrador. |
Consulta Usuarios y roles.
