D13 · L3 · 04 — L2 · AVC Theorem & Fundamental Limits of Autonomous SCL2 · Teorema AVC y Límites Fundamentales de la Cadena Autónoma

Autonomy boundaries: when AI agents should defer to human judgmentLímites de autonomía: cuándo los agentes de IA deben deferir al juicio humano

Autonomy without well-defined limits is an agent optimizing the wrong metric at the critical moment.

La autonomía sin límites bien definidos es el agente que optimiza la métrica equivocada en el momento crítico.

01What it isQué es

Autonomy boundaries are the explicit conditions — novelty, high stakes, conflicting signals, low confidence or external shocks — under which an agent stops and hands the decision to a person, together with the information that person needs to decide quickly.

Los límites de autonomía son las condiciones explícitas —novedad, alto riesgo, señales en conflicto, baja confianza o choques externos— bajo las cuales un agente se detiene y entrega la decisión a una persona, junto con la información que esa persona necesita para decidir rápido.

02Why it mattersPor qué importa

In the Mr. Supply Chain AVC framework, deferral is how a system gives up some Autonomy to protect Veracity and Coordination; set it too loose and the agent fails silently, too tight and people rubber-stamp. Automation is misused when people over-trust it and disused when they under-trust it, so the hand-off between human and machine must be designed (Parasuraman and Riley, 1997 — Human Factors). Europe's AI Act requires high-risk AI systems to be designed so that humans can effectively oversee, override or stop them (European Union, 2024 — Regulation (EU) 2024/1689, Article 14).

En el marco AVC de Mr. Supply Chain, la cesión es la forma en que un sistema renuncia a algo de Autonomía para proteger la Veracidad y la Coordinación; si es muy laxa, el agente falla en silencio, y si es muy estricta, las personas aprueban por inercia. La automatización se usa mal cuando las personas confían de más y se desaprovecha cuando confían de menos, por lo que la transferencia entre humano y máquina debe diseñarse (Parasuraman and Riley, 1997 — Human Factors). La Ley de IA europea exige que los sistemas de IA de alto riesgo se diseñen para que las personas puedan supervisarlos, anularlos o detenerlos de manera efectiva (European Union, 2024 — Regulation (EU) 2024/1689, Article 14).

03How it is doneCómo se hace

1
Define deferral triggers. Write thresholds for value at stake, model confidence, out-of-pattern inputs and contract terms outside standard templates.
2
Package the decision. Send the person the system state, the options considered, the agent's recommendation and its confidence in one message.
3
Recalibrate from outcomes. Review deferral accuracy and response time monthly, and raise or lower thresholds based on how often humans disagree.
1
Define los disparadores de cesión. Escribe umbrales de valor en juego, confianza del modelo, entradas fuera de patrón y términos contractuales fuera de las plantillas estándar.
2
Empaqueta la decisión. Envía a la persona, en un solo mensaje, el estado del sistema, las opciones consideradas, la recomendación del agente y su nivel de confianza.
3
Recalibra con resultados. Revisa cada mes la precisión y el tiempo de respuesta de las cesiones, y sube o baja los umbrales según qué tan seguido discrepan los humanos.

04The concept in depthEl concepto a fondo

👤Autonomy limits: the AVC-implied mechanism for human deferral›
The AVC implies that the correct agent design must include Autonomy limits — the conditions under which the agent recognizes it lacks sufficient information (Veracity failure) or that the decision affects other agents (Coordination failure), and defers the decision to human judgment.
📊The 5 types of conditions requiring human deferral›
(1) Novelty: agent faces a situation not seen in training — out-of-distribution. (2) High stakes: financial or service impact exceeds the agent authorization threshold. (3) Conflicting signals: agent receives contradictory information it cannot resolve. (4) Low confidence: model has <70% confidence in its decision. (5) External events: agent detects events outside its designed variability range.
🔢Deferral mechanism design: how the agent transfers the decision to the human›
The deferral mechanism must: (1) detect the condition with sufficient advance notice, (2) provide all relevant information (system state, options considered, model confidence), (3) wait for the human decision before acting, and (4) learn from the human decision to improve the model for similar future situations.
🏆Intermediate vs. Advanced›
Intermediate: manages agent deferral cases within their authority; makes decisions the agent escalates.

Advanced: designs the deferral mechanism; calibrates deferral thresholds; implements the learning cycle from human decisions.
👤Límites de autonomía: el mecanismo de cesión al humano que implica el AVC›
El AVC implica que el diseño correcto del agente debe incluir límites de Autonomía: las condiciones en las que el agente reconoce que no tiene información suficiente (falla de Veracidad) o que la decisión afecta a otros agentes (falla de Coordinación), y cede la decisión al juicio humano.
📊Los 5 tipos de condiciones que requieren cesión al humano›
(1) Novedad: el agente enfrenta una situación no vista en el entrenamiento (fuera de distribución). (2) Alto riesgo: el impacto financiero o de servicio supera el umbral de autorización del agente. (3) Señales en conflicto: el agente recibe información contradictoria que no puede resolver. (4) Baja confianza: el modelo tiene <70% de confianza en su decisión. (5) Eventos externos: el agente detecta eventos fuera del rango de variabilidad para el que fue diseñado.
🔢Diseño del mecanismo de cesión: cómo el agente transfiere la decisión al humano›
El mecanismo de cesión debe: (1) detectar la condición con suficiente anticipación, (2) entregar toda la información relevante (estado del sistema, opciones consideradas, confianza del modelo), (3) esperar la decisión humana antes de actuar y (4) aprender de la decisión humana para mejorar el modelo en situaciones futuras similares.
🏆Intermedio vs. Avanzado›
Intermedio: gestiona los casos de cesión del agente dentro de su autoridad; toma las decisiones que el agente escala.

Avanzado: diseña el mecanismo de cesión; calibra los umbrales de cesión; implementa el ciclo de aprendizaje a partir de las decisiones humanas.

05In practiceEn la práctica

👤Autonomy limits are the most important design parameter of a supply chain agent — not the model sophistication›
An agent with a very sophisticated model but without deferral mechanisms does not know when it does not know. Autonomy limits are the agent awareness of ignorance.
🔢Deferral thresholds must be calibrated with data from the first months of operation›
The correct thresholds are not evident before seeing the agent real behavior in production. Calibration based on first-months data is the correct practice.
🔗The learning cycle from human decisions is the agent continuous improvement mechanism›
Each human decision before an agent deferral is a training signal: if the human made the same decision the model would have made, the agent can reduce the deferral threshold for similar situations.
📊Document deferral patterns and human decisions — this database is the agent most valuable training asset›
The database of situations, deferral, human decision, and outcome is the most valuable training dataset for improving the agent model over time.
👤Los límites de autonomía son el parámetro de diseño más importante de un agente de supply chain, no la sofisticación del modelo›
Un agente con un modelo muy sofisticado pero sin mecanismos de cesión no sabe cuándo no sabe. Los límites de autonomía son la conciencia que tiene el agente de su propia ignorancia.
🔢Los umbrales de cesión deben calibrarse con datos de los primeros meses de operación›
Los umbrales correctos no son evidentes antes de ver el comportamiento real del agente en producción. Calibrarlos con datos de los primeros meses es la práctica correcta.
🔗El ciclo de aprendizaje a partir de las decisiones humanas es el mecanismo de mejora continua del agente›
Cada decisión humana ante una cesión del agente es una señal de entrenamiento: si el humano tomó la misma decisión que habría tomado el modelo, el agente puede reducir el umbral de cesión para situaciones similares.
📊Documenta los patrones de cesión y las decisiones humanas: esa base de datos es el activo de entrenamiento más valioso del agente›
La base de datos de situación, cesión, decisión humana y resultado es el dataset de entrenamiento más valioso para mejorar el modelo del agente con el tiempo.

06Illustrative caseCaso ilustrativo

Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Illustrative case: Deferral mechanism design — autonomous supplier price negotiation agent
Deferral conditionActivation thresholdInformation the agent provides to the human
High stakes: the agent negotiates a readjustment with >$500K MXN annual impactAnnual impact >$500K MXN → mandatory deferral to Procurement DirectorCurrent price, proposed price, market price from 3 alternative sources, P&L impact, and switching cost to alternative supplier
Novelty: the supplier proposes an Incoterm or contract structure outside the agent 12 standard templatesAny contract term outside standard templates → deferral to legal teamThe proposed term, why it is not in the standard templates, and the most similar clause from existing templates
Conflicting signals: the proposed price is more than ±30% outside the market rangeProposed price >30% outside market range → deferral to buyer with market analysisProposed price, market price from 3 sources, possible reasons for the deviation
Result: The deferral mechanism reduced the override rate (decisions reversed by the human) from 28% to 6%. 94% of agent decisions within its authority range are validated without modification. Deferred decisions (6%) are precisely those of greatest complexity and impact — where human judgment adds real value.
Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Caso ilustrativo: Diseño del mecanismo de cesión — agente autónomo de negociación de precios con proveedores
Condición de cesiónUmbral de activaciónInformación que el agente entrega al humano
Alto riesgo: el agente negocia un reajuste con impacto anual >$500K MXNImpacto anual >$500K MXN → cesión obligatoria al Director de ComprasPrecio actual, precio propuesto, precio de mercado de 3 fuentes alternas, impacto en el P&L y costo de cambio a un proveedor alterno
Novedad: el proveedor propone un Incoterm o una estructura contractual fuera de las 12 plantillas estándar del agenteCualquier término contractual fuera de las plantillas estándar → cesión al equipo legalEl término propuesto, por qué no está en las plantillas estándar y la cláusula más parecida de las plantillas existentes
Señales en conflicto: el precio propuesto está más de ±30% fuera del rango de mercadoPrecio propuesto >30% fuera del rango de mercado → cesión al comprador con análisis de mercadoPrecio propuesto, precio de mercado de 3 fuentes y posibles razones de la desviación
Resultado: El mecanismo de cesión redujo la tasa de override (decisiones revertidas por el humano) de 28% a 6%. El 94% de las decisiones del agente dentro de su rango de autoridad se validan sin modificación. Las decisiones cedidas (6%) son precisamente las de mayor complejidad e impacto, donde el juicio humano agrega valor real.

07How it is measuredCómo se mide

👤Deferral Accuracy %›
Deferral Accuracy %
(Agent deferrals where the human made a different decision than the agent recommendation / Total deferrals) × 100
Benchmark: 30–60% in well-calibrated agents · <10% indicates the agent is deferring too much (human always confirms) · >80% indicates the agent should defer more
⚠️ A deferral accuracy of 5% indicates the agent is deferring cases where the human always confirms its recommendation — suggesting the deferral threshold is too low.
⏱️Deferral Response Time›
Deferral Response Time
Average time from when the agent generates the deferral until the human makes the decision
Benchmark: <2 hours for operational deferrals · <24 hours for strategic deferrals
🔑 Human response speed to the deferral determines if the deferral mechanism is operationally viable.
👤Deferral Accuracy %›
Deferral Accuracy % (precisión de cesión)
(Cesiones del agente en las que el humano tomó una decisión distinta a la recomendación del agente / Total de cesiones) × 100
Benchmark: 30–60% en agentes bien calibrados · <10% indica que el agente cede demasiado (el humano siempre confirma) · >80% indica que el agente debería ceder más
⚠️ Una precisión de cesión de 5% indica que el agente cede casos en los que el humano siempre confirma su recomendación, lo que sugiere que el umbral de cesión es demasiado bajo.
⏱️Deferral Response Time›
Deferral Response Time (tiempo de respuesta a la cesión)
Tiempo promedio desde que el agente genera la cesión hasta que el humano toma la decisión
Benchmark: <2 horas para cesiones operativas · <24 horas para cesiones estratégicas
🔑 La velocidad de respuesta humana a la cesión determina si el mecanismo es operativamente viable.

08What you would useQué se usa

📌 Human-Agent Teaming
🟦LangGraph Human-in-the-Loop›
Module: Structured Human Oversight + Agent Deferral Framework

LangGraph natively implements the human-in-the-loop pattern with configurable breakpoints where the agent pauses and waits for human approval before continuing.
🟧Slack / Microsoft Teams + Webhook›
Module: Human Notification + Approval Interface for Agent Deferrals

Enterprise messaging platforms are the most widely adopted notification channel for deferrals — the buyer receives the notification with all relevant information and approves directly in the chat.
📌 Trabajo conjunto humano-agente
🟦LangGraph Human-in-the-Loop›
Módulo: Supervisión humana estructurada + framework de cesión del agente

LangGraph implementa de forma nativa el patrón human-in-the-loop con puntos de interrupción configurables en los que el agente se detiene y espera la aprobación humana antes de continuar.
🟧Slack / Microsoft Teams + Webhook›
Módulo: Interfaz de notificación y aprobación humana para cesiones del agente

Las plataformas de mensajería empresarial son el canal de notificación más adoptado para las cesiones: el comprador recibe la notificación con toda la información relevante y aprueba directamente en el chat.
The bottom lineEn corto

A good agent knows when it does not know — and asks the right person fast.

Un buen agente sabe cuándo no sabe, y le pregunta rápido a la persona correcta.

All D13 componentsTodos los componentes de D13D13 artifactsArtifacts de D13SCRA