01What it isQué es
Agent incident response is the rehearsed protocol to detect that an agent is deciding badly, pause it and switch to a manual backup, find the root cause and bring it back under closer watch.
La respuesta a incidentes de agentes es el protocolo ensayado para detectar que un agente está decidiendo mal, pausarlo y pasar a un respaldo manual, encontrar la causa raíz y reactivarlo bajo una vigilancia más estrecha.
02Why it mattersPor qué importa
Agent failures are often silent: the agent keeps running while a changed input, such as a new supplier status code, makes every decision slightly wrong. Automation erodes the manual skills that operators need precisely when the automated system fails (Bainbridge, 1983 — Automatica), which is why the backup process must be documented and practiced. Mature incident handling follows preparation, detection and analysis, containment and recovery, and post-incident learning (Cichonski, Millar, Grance and Scarfone, 2012 — NIST SP 800-61 Rev. 2).
Las fallas de los agentes suelen ser silenciosas: el agente sigue operando mientras un insumo que cambió, como un nuevo código de estatus del proveedor, vuelve cada decisión ligeramente incorrecta. La automatización erosiona las habilidades manuales que los operadores necesitan justo cuando el sistema automatizado falla (Bainbridge, 1983 — Automatica), y por eso el proceso de respaldo debe documentarse y practicarse. La gestión madura de incidentes sigue las fases de preparación, detección y análisis, contención y recuperación, y aprendizaje posterior al incidente (Cichonski, Millar, Grance and Scarfone, 2012 — NIST SP 800-61 Rev. 2).
03How it is doneCómo se hace
04The concept in depthEl concepto a fondo
Advanced: designs the incident response protocol for the agent portfolio; leads root cause analysis under the AVC framework; manages the recovery and reactivation process.
Avanzado: diseña el protocolo de respuesta a incidentes para el portafolio de agentes; lidera el análisis de causa raíz bajo el marco AVC; gestiona el proceso de recuperación y reactivación.
05In practiceEn la práctica
06Illustrative caseCaso ilustrativo
The reorder agent begins systematically generating under-dimensioned POs without triggering any obvious failure alert.
| Incident response phase | Time since failure started | Actions taken |
|---|---|---|
| Detection: the automated monitoring detects that the agent override rate rose from 12% to 38% in 3 days | Week 3, Day 2 · The monitoring alert activates when override rate exceeds 25% | The monitoring dashboard alerts the Agent Owner at 8:23am · The Agent Owner confirms the incident and activates the runbook |
| Containment: the agent is paused and the manual backup process is activated | Week 3, Day 2 · 47 minutes after detection | The reorder agent is paused in the ERP · The buyer team activates the manual ROP review process for the 1,800 SKUs · The manual process takes 8 hours vs. 15 minutes for the agent |
| Root cause analysis under the AVC framework | Week 3, Days 3–4 | The AVC analysis identifies a Veracity failure: the primary supplier changed its PO confirmation process — POs now appear in the ERP as in process instead of confirmed · The agent interpreted in process as unconfirmed and generated additional duplicate POs |
El agente de reorden empieza a generar sistemáticamente OC subdimensionadas sin disparar ninguna alerta de falla evidente.
| Fase de respuesta al incidente | Tiempo desde el inicio de la falla | Acciones tomadas |
|---|---|---|
| Detección: el monitoreo automático detecta que la tasa de override del agente subió de 12% a 38% en 3 días | Semana 3, día 2 · La alerta de monitoreo se activa cuando la tasa de override supera 25% | El dashboard de monitoreo alerta al Agent Owner a las 8:23 am · El Agent Owner confirma el incidente y activa el runbook |
| Contención: el agente se pausa y se activa el proceso manual de respaldo | Semana 3, día 2 · 47 minutos después de la detección | El agente de reorden se pausa en el ERP · El equipo de compradores activa el proceso manual de revisión del ROP para los 1,800 SKU · El proceso manual toma 8 horas vs. 15 minutos del agente |
| Análisis de causa raíz bajo el marco AVC | Semana 3, días 3–4 | El análisis AVC identifica una falla de Veracidad: el proveedor principal cambió su proceso de confirmación de OC; ahora las OC aparecen en el ERP como "en proceso" en lugar de "confirmadas" · El agente interpretó "en proceso" como no confirmada y generó OC adicionales duplicadas |
07How it is measuredCómo se mide
08What you would useQué se usa
LangSmith and Arize AI for real-time monitoring of agent behavior and automatic alert generation.
ITIL-based runbook template adapted for AI agents — with sections for anomaly detection, containment, manual backup process, root cause analysis, and recovery.
LangSmith y Arize AI para el monitoreo en tiempo real del comportamiento del agente y la generación automática de alertas.
Plantilla de runbook basada en ITIL adaptada para agentes de IA, con secciones de detección de anomalías, contención, proceso manual de respaldo, análisis de causa raíz y recuperación.
Every agent needs an off switch and a manual plan B that people have actually practiced.
Todo agente necesita un botón de apagado y un plan B manual que el equipo realmente haya practicado.
All D13 componentsTodos los componentes de D13D13 artifactsArtifacts de D13SCRA