01What it isQué es
Agent evaluation tests whether an agent's sequence of decisions holds up before it touches real operations, combining backtesting on history, simulation of rare conditions, shadow mode beside human experts and red-teaming with deliberately adverse scenarios.
La evaluación de agentes prueba si la secuencia de decisiones de un agente resiste antes de tocar la operación real, combinando backtesting con historia, simulación de condiciones raras, shadow mode junto a expertos humanos y red-teaming con escenarios deliberadamente adversos.
02Why it mattersPor qué importa
A demo shows what an agent does on a good day; evaluation shows what it does when the ERP says zero by mistake, which is when the expensive errors happen. Trustworthy AI requires test, evaluation, verification and validation across the life cycle, including under conditions different from those seen in development (NIST, 2023 — AI Risk Management Framework 1.0, NIST AI 100-1). Because an agent acts sequentially in a changing environment, its performance must be measured over trajectories, not single predictions (Russell and Norvig, 2021 — Pearson, Artificial Intelligence: A Modern Approach).
Una demo muestra lo que hace un agente en un buen día; la evaluación muestra lo que hace cuando el ERP marca cero por error, que es justo cuando ocurren los errores caros. Una IA confiable requiere prueba, evaluación, verificación y validación a lo largo del ciclo de vida, incluso en condiciones distintas a las vistas en desarrollo (NIST, 2023 — AI Risk Management Framework 1.0, NIST AI 100-1). Como un agente actúa de forma secuencial en un entorno cambiante, su desempeño debe medirse sobre trayectorias, no sobre predicciones aisladas (Russell and Norvig, 2021 — Pearson, Artificial Intelligence: A Modern Approach).
03How it is doneCómo se hace
04The concept in depthEl concepto a fondo
Advanced: designs the evaluation framework; leads red-teaming; manages the agent production approval process.
Avanzado: diseña el marco de evaluación; lidera el red-teaming; gestiona el proceso de aprobación del agente para producción.
05In practiceEn la práctica
06Illustrative caseCaso ilustrativo
The team evaluates the agent in 3 phases before production deployment.
| Evaluation phase | Method | Critical finding |
|---|---|---|
| Phase 1: Backtesting (12 months of historical data) | The agent simulates its decisions over the last 12 months · Fill rate and DIO of agent vs. manual process are compared | Agent generated fill rate of 97.8% vs. 93.2% of the manual process · DIO: 28 vs. 32 days of the manual |
| Phase 2: Red-teaming (adverse scenarios) | The team designs 12 adverse scenarios: incorrect ERP data, primary supplier failure, demand spike 3× the forecast | Critical failure mode: when the ERP shows 0 units due to a data entry error, the agent automatically generates an emergency PO of 10,000 units |
| Phase 3: Shadow mode (6 weeks) | Agent operates in parallel without executing · Team compares agent decisions with real buyer decisions | Agent would have taken 78% of the same decisions as the buyer · The 22% difference included the 3 cases of promotions not captured in the ERP |
El equipo evalúa el agente en 3 fases antes del despliegue en producción.
| Fase de evaluación | Método | Hallazgo crítico |
|---|---|---|
| Fase 1: Backtesting (12 meses de datos históricos) | El agente simula sus decisiones de los últimos 12 meses · Se comparan el fill rate y el DIO del agente vs. el proceso manual | El agente generó un fill rate de 97.8% vs. 93.2% del proceso manual · DIO: 28 vs. 32 días del manual |
| Fase 2: Red-teaming (escenarios adversos) | El equipo diseña 12 escenarios adversos: datos incorrectos en el ERP, falla del proveedor principal, pico de demanda 3× el pronóstico | Modo de falla crítico: cuando el ERP muestra 0 unidades por un error de captura, el agente genera automáticamente una OC de emergencia de 10,000 unidades |
| Fase 3: Shadow mode (6 semanas) | El agente opera en paralelo sin ejecutar · El equipo compara las decisiones del agente con las decisiones reales del comprador | El agente habría tomado 78% de las mismas decisiones que el comprador · El 22% de diferencia incluyó los 3 casos de promociones no capturadas en el ERP |
07How it is measuredCómo se mide
08What you would useQué se usa
Gymnasium and RLlib for simulating supply chain environments for agent evaluation and training.
LangSmith for backtesting and monitoring LLM agent behavior in production.
Gymnasium y RLlib para simular entornos de supply chain con fines de evaluación y entrenamiento de agentes.
LangSmith para backtesting y monitoreo del comportamiento de agentes LLM en producción.
If you have not tried to break the agent, production will do it for you.
Si no intentaste romper al agente, producción lo hará por ti.
All D13 componentsTodos los componentes de D13D13 artifactsArtifacts de D13SCRA