D12 · L3 · 02 — L2 · Analytics-Driven Operations & Continuous ImprovementL2 · Operación Basada en Analítica y Mejora Continua

A/B testing & experimentation in supply chain: validating operational changesA/B testing y experimentación en SC: validando mejoras operativas con datos

An operational change without a controlled experiment is an improvement you never know actually worked.

El cambio operativo sin experimento controlado es la mejora que no sabes si funcionó.

01What it isQué es

A/B testing in supply chain randomly splits orders, SKUs or locations between the current process and a proposed change, then compares the results statistically to prove whether the change caused the improvement.

El A/B testing en supply chain divide aleatoriamente pedidos, SKUs o ubicaciones entre el proceso actual y un cambio propuesto, y compara los resultados estadísticamente para demostrar si el cambio causó la mejora.

02Why it mattersPor qué importa

Historical comparisons mislead because carriers, policies and models rarely get comparable work — the better-looking option may simply have received the easier orders. Randomized controlled experiments are the most reliable way to establish that a change causes an outcome, provided sample size, duration and a single tested change are designed in advance (Kohavi, Tang and Xu, 2020 — Cambridge University Press).

Las comparaciones históricas engañan porque los transportistas, las políticas y los modelos rara vez reciben trabajo comparable: la opción que se ve mejor quizá solo recibió los pedidos más fáciles. Los experimentos controlados aleatorizados son la forma más confiable de establecer que un cambio causa un resultado, siempre que el tamaño de muestra, la duración y un único cambio a probar se diseñen por adelantado (Kohavi, Tang and Xu, 2020 — Cambridge University Press).

03How it is doneCómo se hace

1
Define one change. State the single variable under test, the KPI that decides and the minimum effect worth acting on.
2
Size and randomize. Calculate the sample and duration needed for adequate power, then assign orders or SKUs to each variant at random.
3
Decide on significance. Read the result only at the planned end, check the p-value and confidence interval, and roll out only what is both significant and material.
1
Definir un solo cambio. Establecer la única variable a probar, el KPI que decide y el efecto mínimo que justifica actuar.
2
Dimensionar y aleatorizar. Calcular la muestra y la duración necesarias para tener poder estadístico suficiente y asignar pedidos o SKUs a cada variante al azar.
3
Decidir con significancia. Leer el resultado solo al final planeado, revisar el p-value y el intervalo de confianza, y escalar solo lo que sea significativo y relevante.

04The concept in depthEl concepto a fondo

🔬A/B testing in supply chain: the science that replaces intuition in improvement decisions›
A/B testing compares two process variants in a controlled and random way to measure the real impact of the change with statistical evidence — eliminating selection biases. Use cases: carrier comparison, safety stock policy evaluation, new forecast model validation, new packaging configuration testing.
📊Statistical requirements for A/B testing in supply chain›
(1) Random assignment: no bias in which orders or SKUs go to each variant. (2) Sample size sufficient to detect the expected effect with 80%+ statistical power. (3) Sufficient duration: minimum 4–8 weeks to capture temporal supply chain variability. (4) A single change variable: if you change the carrier and packaging simultaneously, you can't attribute the result to either.
🔢A/B testing vs. historical analysis: the difference is causality›
Historical data analysis can show that carrier B has better OTIF — but it may be because it receives shorter-distance orders. A/B testing with random assignment eliminates these selection biases and demonstrates causality, not just correlation.
🏆Intermediate vs. Advanced›
Intermediate: participates in defined A/B testing experiments; manages KPI tracking for the assigned variant.

Advanced: designs experiments with correct statistical requirements; leads implementation; interprets results with statistical rigor.
🔬A/B testing en supply chain: la ciencia que sustituye la intuición en las decisiones de mejora›
El A/B testing compara dos variantes de un proceso de forma controlada y aleatoria para medir el impacto real del cambio con evidencia estadística, eliminando sesgos de selección. Casos de uso: comparación de transportistas, evaluación de políticas de inventario de seguridad, validación de nuevos modelos de pronóstico, prueba de nuevas configuraciones de empaque.
📊Requisitos estadísticos del A/B testing en supply chain›
(1) Asignación aleatoria: sin sesgo en qué pedidos o SKUs van a cada variante. (2) Tamaño de muestra suficiente para detectar el efecto esperado con 80%+ de poder estadístico. (3) Duración suficiente: mínimo 4–8 semanas para capturar la variabilidad temporal de supply chain. (4) Una sola variable de cambio: si se cambian transportista y empaque al mismo tiempo, el resultado no puede atribuirse a ninguno de los dos.
🔢A/B testing vs. análisis histórico: la diferencia es la causalidad›
El análisis de datos históricos puede mostrar que el transportista B tiene mejor OTIF, pero puede deberse a que recibe pedidos de menor distancia. El A/B testing con asignación aleatoria elimina estos sesgos de selección y demuestra causalidad, no solo correlación.
🏆Intermedio vs. Avanzado›
Intermedio: participa en experimentos de A/B testing definidos; gestiona el seguimiento de KPIs de la variante asignada.

Avanzado: diseña experimentos con los requisitos estadísticos correctos; lidera la implementación; interpreta los resultados con rigor estadístico.

05In practiceEn la práctica

🔬A/B testing is the only method that demonstrates causality — not just correlation›
Historical analysis can show correlation. A/B testing with random assignment demonstrates the change caused the result.
🔢Calculate the required sample size before starting — not after›
A 2-week experiment with 200 orders may not have sufficient statistical power to detect a 3% OTIF improvement.
🔗Change only one variable in each experiment›
The most frequent error: changing both carrier AND packaging simultaneously and not knowing which one to attribute the damage rate improvement to.
📅Design the experiment with sufficient duration to capture seasonal and operational variability›
The minimum duration for most supply chain experiments is 4–8 weeks.
🔬El A/B testing es el único método que demuestra causalidad, no solo correlación›
El análisis histórico puede mostrar correlación. El A/B testing con asignación aleatoria demuestra que el cambio causó el resultado.
🔢Calcular el tamaño de muestra requerido antes de empezar, no después›
Un experimento de 2 semanas con 200 pedidos puede no tener suficiente poder estadístico para detectar una mejora de 3% en OTIF.
🔗Cambiar solo una variable en cada experimento›
El error más frecuente: cambiar transportista Y empaque al mismo tiempo y no saber a cuál atribuir la mejora en la tasa de daños.
📅Diseñar el experimento con duración suficiente para capturar la variabilidad estacional y operativa›
La duración mínima para la mayoría de los experimentos de supply chain es de 4–8 semanas.

06Illustrative caseCaso ilustrativo

Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Illustrative case: Carrier A/B testing — e-commerce company, evaluation of 2 last-mile carriers in CDMX
8 weeks. CDMX orders randomly assigned between current carrier (A) and new carrier (B).
A/B test KPICarrier A (current)Carrier B (new) + significance
On-time delivery rate %87.2% · n=4,840 orders93.1% · p<0.001 · statistically significant with 99% confidence
Damage rate %2.1%0.8% · p=0.003 · significant
Post-delivery customer NPS6274 · p<0.001 · +12 NPS points
Result: The A/B test shows carrier B is statistically superior on all 3 metrics. The company migrates 100% of CDMX volume to carrier B. The 8-week test cost $42K MXN and prevented making the decision based only on price ($0.80/order more expensive) without considering OTIF and NPS.
Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Caso ilustrativo: A/B testing de transportistas — empresa de e-commerce, evaluación de 2 transportistas de última milla en CDMX
8 semanas. Pedidos de CDMX asignados aleatoriamente entre el transportista actual (A) y el nuevo (B).
KPI del A/B testTransportista A (actual)Transportista B (nuevo) + significancia
Tasa de entregas a tiempo %87.2% · n=4,840 pedidos93.1% · p<0.001 · estadísticamente significativo con 99% de confianza
Tasa de daños %2.1%0.8% · p=0.003 · significativo
NPS del cliente después de la entrega6274 · p<0.001 · +12 puntos de NPS
Resultado: El A/B test muestra que el transportista B es estadísticamente superior en las 3 métricas. La empresa migra el 100% del volumen de CDMX al transportista B. La prueba de 8 semanas costó $42K MXN y evitó tomar la decisión solo por precio ($0.80 más caro por pedido) sin considerar OTIF y NPS.

07How it is measuredCómo se mide

🔬A/B Test Statistical Significance (p-value)›
A/B Test Statistical Significance (p-value)
p-value of the statistical test (t-test, chi-squared) comparing variants A and B
Benchmark: p < 0.05 to declare a statistically significant result · p < 0.01 for high financial impact decisions
⚠️ A 5% OTIF improvement in carrier B may be statistical noise if the sample size is small.
📊Experiment Velocity (number of A/B tests per quarter)›
Experiment Velocity (number of A/B tests per quarter)
Number of experiments completed with statistically valid results per quarter
Benchmark: 2–5 experiments per quarter in organizations with an active experimentation culture
🔑 Experimentation velocity is the continuous improvement culture metric.
🔬Significancia estadística del A/B test (p-value)›
Significancia estadística del A/B test (p-value)
p-value de la prueba estadística (prueba t, ji cuadrada) que compara las variantes A y B
Benchmark: p < 0.05 para declarar un resultado estadísticamente significativo · p < 0.01 para decisiones de alto impacto financiero
⚠️ Una mejora de 5% en OTIF del transportista B puede ser ruido estadístico si el tamaño de muestra es pequeño.
📊Velocidad de experimentación (número de A/B tests por trimestre)›
Velocidad de experimentación (número de A/B tests por trimestre)
Número de experimentos concluidos con resultados estadísticamente válidos por trimestre
Benchmark: 2–5 experimentos por trimestre en organizaciones con una cultura activa de experimentación
🔑 La velocidad de experimentación es la métrica de la cultura de mejora continua.

08What you would useQué se usa

📌 A/B Testing Tools
🟧Python — scipy.stats + pingouin›
Module: Statistical Testing for Supply Chain Experiments

Python libraries for experiment statistical analysis: sample size calculation, t-tests, chi-squared, and statistical power.
🟦Optimizely / VWO›
Module: Experimentation Platform for Digital + Operational Tests

For experiments involving the supply chain digital interface (checkout, customer notifications).
📌 Herramientas de A/B testing
🟧Python — scipy.stats + pingouin›
Módulo: Pruebas estadísticas para experimentos de supply chain

Bibliotecas de Python para el análisis estadístico de experimentos: cálculo de tamaño de muestra, pruebas t, ji cuadrada y poder estadístico.
🟦Optimizely / VWO›
Módulo: Plataforma de experimentación para pruebas digitales + operativas

Para experimentos que involucran la interfaz digital de supply chain (checkout, notificaciones al cliente).
The bottom lineEn corto

Do not ask which option looked better last quarter — run a fair test and let the data decide.

No preguntes qué opción se vio mejor el trimestre pasado: haz una prueba justa y deja que los datos decidan.

All D12 componentsTodos los componentes de D12D12 artifactsArtifacts de D12SCRA