D16 · L3 · 20 — L2 · AI & Autonomous Operations in SCL2 · IA y Operación Autónoma en la Cadena

Predictive analytics and ML forecasting: moving beyond statistical baselinesAnalytics predictivo y pronóstico ML: más allá de las bases estadísticas

ML that brings in external signals beats ARIMA when the market moves fast.

El ML que incorpora señales externas supera al ARIMA cuando el mercado cambia rápido.

01What it isQué es

ML forecasting uses machine learning models — gradient boosting, neural networks, ensembles — that learn from demand history plus calendar, promotion, price and external signals, and must beat a statistical baseline on held-out data to earn their place.

El pronóstico con ML usa modelos de aprendizaje automático — gradient boosting, redes neuronales, ensambles — que aprenden de la historia de demanda junto con variables de calendario, promoción, precio y señales externas, y deben superar a una línea base estadística en datos de validación para ganarse su lugar.

02Why it mattersPor qué importa

ML wins where demand responds to drivers that history alone cannot explain, such as promotions and prices across many related SKUs. In the M5 competition on Walmart sales data, the most accurate methods were gradient-boosted ML models that learned across thousands of related series and used price and calendar drivers (Makridakis, Spiliotis and Assimakopoulos, 2022 — International Journal of Forecasting). The practical rule is to segment the portfolio and use ML only where it measurably helps.

El ML gana donde la demanda responde a impulsores que la historia por sí sola no explica, como promociones y precios en muchos SKU relacionados. En la competencia M5, con datos de ventas de Walmart, los métodos más precisos fueron modelos de ML con gradient boosting que aprendían de miles de series relacionadas y usaban variables de precio y calendario (Makridakis, Spiliotis y Assimakopoulos, 2022 — International Journal of Forecasting). La regla práctica es segmentar el portafolio y usar ML solo donde ayuda de forma medible.

03How it is doneCómo se hace

1
Segment the SKU portfolio. Assign statistical, ML, intermittent (Croston/SBA) or new-product methods by volume, volatility and history.
2
Backtest against the baseline. Compare MAPE on a held-out period that mirrors real operating conditions before going live.
3
Retrain on a schedule. Set retraining cadence by SKU class and watch accuracy KPIs for early drift.
1
Segmentar el portafolio de SKU. Asignar métodos estadísticos, de ML, intermitentes (Croston/SBA) o de producto nuevo según volumen, volatilidad e historia.
2
Comparar contra la línea base. Medir el MAPE en un periodo reservado que refleje condiciones reales de operación antes de salir a producción.
3
Reentrenar con calendario. Fijar la cadencia de reentrenamiento por clase de SKU y vigilar los KPI de precisión para detectar deriva temprana.

04The concept in depthEl concepto a fondo

📈The SC forecasting hierarchy: 4 methods and when to use each›
(1) Statistical methods (ARIMA, ETS, Prophet): the baseline for stable, history-rich demand — interpretable, auditable, and computationally efficient at scale. The reference against which ML models must demonstrate improvement. (2) Classical ML (XGBoost, LightGBM): the workhorse for demand sensing — incorporates external signals (promotions, weather, competitor activity) that statistical methods cannot capture. (3) Deep learning (LSTM, Transformer): strong for complex multi-variate patterns at scale — tends to pay off when long, rich histories exist across many related series. (4) Hybrid ensemble: combines statistical baselines, ML layers, and expert judgment overrides — the architecture used in best-in-class SC planning systems.
🔢The 3 most impactful ML use cases beyond demand forecasting in SC›
(1) Supplier risk scoring: ML models that predict supplier delivery failure probability from historical scorecard data, financial signals, and geopolitical event feeds — enabling proactive risk mitigation before the failure occurs. (2) Dynamic safety stock optimization: ML-based safety stock models that update safety stock levels in real time based on current demand volatility, lead time variability, and service level performance — replacing static z × σ formulas with adaptive policies. (3) Freight cost prediction: ML models that predict shipment cost at the PO creation stage — enabling procurement to select optimal carriers and modes based on predicted cost and transit time.
📊Feature engineering for SC ML models: the 5 feature categories that drive accuracy›
(1) Demand history: the time series of past demand at SKU-location level — the foundation of any demand model. (2) Calendar features: day of week, week of month, holiday proximity, fiscal period — systematic temporal patterns. (3) Promotional features: planned and actual promotional activity, pricing changes, display presence — the dominant driver of demand lift for promotional SKUs. (4) External signals: weather, macroeconomic indicators, competitor stockouts, web search trends — indirect demand drivers. (5) Supply features: lead time, supplier reliability, inventory position — the supply-side constraints that shape what demand can be fulfilled.
🏆Intermediate vs. Advanced›
Intermediate: works with ML model outputs; provides domain knowledge for feature selection; validates model recommendations against operational experience.

Advanced: designs and trains SC ML models; governs model accuracy, bias, and retraining cadence; selects the forecasting hierarchy for each SKU class; integrates ML outputs into the planning workflow.
📈La jerarquía de pronóstico en la cadena: 4 métodos y cuándo usar cada uno›
(1) Métodos estadísticos (ARIMA, ETS, Prophet): la línea base para demanda estable y con historia abundante — interpretables, auditables y computacionalmente eficientes a escala. Son la referencia contra la cual los modelos de ML deben demostrar mejora. (2) ML clásico (XGBoost, LightGBM): el caballo de batalla del demand sensing — incorpora señales externas (promociones, clima, actividad de la competencia) que los métodos estadísticos no captan. (3) Deep learning (LSTM, Transformer): fuerte en patrones multivariados complejos a escala — suele rendir cuando hay historias largas y ricas en muchas series relacionadas. (4) Ensamble híbrido: combina líneas base estadísticas, capas de ML y ajustes por juicio experto — la arquitectura de los sistemas de planeación de mejor nivel.
🔢Los 3 casos de uso de ML de mayor impacto en la cadena más allá del pronóstico de la demanda›
(1) Calificación de riesgo de proveedores: modelos de ML que predicen la probabilidad de falla en la entrega a partir del historial de scorecards, señales financieras y fuentes de eventos geopolíticos, lo que permite mitigar el riesgo antes de la falla. (2) Optimización dinámica del inventario de seguridad: modelos de ML que actualizan los niveles de inventario de seguridad en tiempo real según la volatilidad actual de la demanda, la variabilidad del lead time y el desempeño del nivel de servicio, y sustituyen las fórmulas estáticas z × σ por políticas adaptativas. (3) Predicción del costo de flete: modelos de ML que predicen el costo del embarque desde la creación de la orden de compra, para que compras elija transportistas y modos óptimos según el costo y el tiempo de tránsito previstos.
📊Ingeniería de variables para modelos de ML en la cadena: las 5 categorías que impulsan la precisión›
(1) Historia de demanda: la serie de tiempo de la demanda pasada a nivel SKU-ubicación — la base de cualquier modelo de demanda. (2) Variables de calendario: día de la semana, semana del mes, cercanía a días festivos, periodo fiscal — patrones temporales sistemáticos. (3) Variables promocionales: actividad promocional planeada y real, cambios de precio, presencia en exhibición — el principal impulsor del alza de demanda en SKU promocionales. (4) Señales externas: clima, indicadores macroeconómicos, quiebres de inventario de la competencia, tendencias de búsqueda web — impulsores indirectos de la demanda. (5) Variables de suministro: lead time, confiabilidad del proveedor, posición de inventario — las restricciones del lado del suministro que determinan qué demanda puede atenderse.
🏆Intermedio vs. Avanzado›
Intermedio: trabaja con los resultados de modelos de ML; aporta conocimiento del dominio para seleccionar variables; valida las recomendaciones del modelo contra la experiencia operativa.

Avanzado: diseña y entrena modelos de ML para la cadena; gobierna su precisión, sesgo y cadencia de reentrenamiento; selecciona la jerarquía de pronóstico para cada clase de SKU; integra los resultados de ML en el flujo de planeación.

05In practiceEn la práctica

📈Prove ML improvement on a validation holdout before deploying in production — never skip backtesting›
ML models can overfit to training data and fail spectacularly on new data — including the exact demand patterns (promotions, seasonality) they were supposed to capture. A held-out validation set that mirrors real operating conditions is the minimum validation standard before production deployment.
📊Segment the SKU portfolio before selecting forecasting methods — one method for all SKUs is never optimal›
High-velocity stable SKUs are best served by statistical methods. High-volatility promotional SKUs by ML with promotional features. Intermittent slow-movers by Croston/SBA. New products by collaborative filtering seeding. The forecasting hierarchy — matching method to SKU characteristics — is more valuable than any single sophisticated model applied uniformly.
🔗Automate model retraining on a defined cadence — ML models degrade as supply chain conditions change›
ML models trained on historical data degrade as demand patterns, promotional strategies, and market conditions evolve. Define a retraining cadence (weekly for high-velocity SKUs, monthly for standard) and monitor accuracy KPIs for early degradation signals.
📈Demostrar la mejora del ML en un conjunto de validación (holdout) antes de llevarlo a producción — nunca omitir el backtesting›
Los modelos de ML pueden sobreajustarse a los datos de entrenamiento y fallar de forma espectacular con datos nuevos, incluso en los patrones de demanda (promociones, estacionalidad) que debían captar. Un conjunto de validación reservado que refleje las condiciones reales de operación es el estándar mínimo antes del despliegue en producción.
📊Segmentar el portafolio de SKU antes de elegir los métodos de pronóstico — un solo método para todos los SKU nunca es óptimo›
Los SKU estables de alta rotación se atienden mejor con métodos estadísticos; los SKU promocionales de alta volatilidad, con ML con variables promocionales; los de movimiento lento e intermitente, con Croston/SBA; los productos nuevos, con arranque por filtrado colaborativo. La jerarquía de pronóstico — asignar el método según las características del SKU — vale más que cualquier modelo sofisticado aplicado de manera uniforme.
🔗Automatizar el reentrenamiento de modelos con una cadencia definida — los modelos de ML se degradan conforme cambian las condiciones de la cadena›
Los modelos de ML entrenados con datos históricos se degradan conforme evolucionan los patrones de demanda, las estrategias promocionales y las condiciones de mercado. Hay que definir una cadencia de reentrenamiento (semanal para SKU de alta rotación, mensual para los estándar) y monitorear los KPI de precisión para detectar señales tempranas de degradación.

06Illustrative caseCaso ilustrativo

Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Illustrative case: ML demand sensing implementation — retail food distributor, 2024
MetricStatistical baselineML ensemble (3 months)
1-week MAPE (all SKUs)28.4%19.7% (−31%)
1-week MAPE (promotional SKUs)41.2%24.8% (−40%)
Emergency replenishment orders89/week38/week (−57%)
Result: ML ensemble reduced 1-week MAPE by 31% vs. statistical baseline — with the largest improvement on promotional SKUs (40%). Emergency replenishment orders fell 57% as a direct result of improved short-horizon accuracy. ML model ROI payback: 8 months from implementation to cost recovery.
Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Caso ilustrativo: Implementación de demand sensing con ML — distribuidor minorista de alimentos, 2024
MétricaLínea base estadísticaEnsamble de ML (3 meses)
MAPE a 1 semana (todos los SKU)28.4%19.7% (−31%)
MAPE a 1 semana (SKU promocionales)41.2%24.8% (−40%)
Órdenes de reabastecimiento de emergencia89/semana38/semana (−57%)
Resultado: El ensamble de ML redujo 31% el MAPE a 1 semana frente a la línea base estadística, con la mayor mejora en SKU promocionales (40%). Las órdenes de reabastecimiento de emergencia cayeron 57% como resultado directo de la mejor precisión de corto plazo. Recuperación de la inversión del modelo de ML: 8 meses desde la implementación.

07How it is measuredCómo se mide

📈ML Model Accuracy Lift % (MAPE improvement vs. statistical baseline)›
ML Model Accuracy Lift % (MAPE improvement vs. statistical baseline)
((MAPE_statistical − MAPE_ML) / MAPE_statistical) × 100 — measured on holdout validation set by SKU class
Benchmark: >20% MAPE improvement vs. statistical baseline on high-volatility SKUs justifies ML complexity · <10% improvement means statistical models are sufficient
🔑 If ML models do not outperform statistical baselines by >15% on validation data, the complexity premium is not justified. Common causes: insufficient training data, poor feature engineering, or the statistical model is already well-calibrated for the demand pattern.
📈Mejora de precisión del modelo de ML % (mejora del MAPE vs. la línea base estadística)›
Mejora de precisión del modelo de ML % (mejora del MAPE vs. la línea base estadística)
((MAPE_estadístico − MAPE_ML) / MAPE_estadístico) × 100 — medido en el conjunto de validación por clase de SKU
Referencia: >20% de mejora en MAPE vs. la línea base estadística en SKU de alta volatilidad justifica la complejidad del ML · <10% de mejora significa que los modelos estadísticos son suficientes
🔑 Si los modelos de ML no superan a las líneas base estadísticas en más de 15% con datos de validación, la prima de complejidad no se justifica. Causas comunes: datos de entrenamiento insuficientes, mala ingeniería de variables o un modelo estadístico que ya está bien calibrado para el patrón de demanda.

08What you would useQué se usa

📌 ML Forecasting Platforms for SC
🟦Nixtla (TimeGPT / NeuralForecast)›
Module: Neural Time Series Forecasting

Nixtla provides open-source implementations of neural forecasting models (N-BEATS, N-HiTS) and its own foundation model TimeGPT, designed for time series forecasting — often competitive with or better than statistical baselines on high-volatility SC demand data.
🟦Amazon SageMaker / Google Vertex AI›
Module: Cloud ML Forecasting

Amazon SageMaker (Canvas and AutoGluon time series) and Google Vertex AI provide managed ML forecasting services with built-in feature engineering, model selection, and explainability — reducing the ML engineering overhead for SC forecasting deployments. (Amazon Forecast was closed to new customers in 2024.)
📌 Plataformas de pronóstico con ML para la cadena
🟦Nixtla (TimeGPT / NeuralForecast)›
Módulo: Pronóstico neuronal de series de tiempo

Nixtla ofrece implementaciones de código abierto de modelos neuronales de pronóstico (N-BEATS, N-HiTS) y su propio modelo base TimeGPT, diseñados para series de tiempo; con frecuencia compiten con las líneas base estadísticas o las superan en demanda de alta volatilidad.
🟦Amazon SageMaker / Google Vertex AI›
Módulo: Pronóstico con ML en la nube

Amazon SageMaker (Canvas y AutoGluon para series de tiempo) y Google Vertex AI ofrecen servicios administrados de pronóstico con ML, con ingeniería de variables, selección de modelos y explicabilidad integradas, lo que reduce la carga de ingeniería de ML en los despliegues de pronóstico. (Amazon Forecast se cerró a nuevos clientes en 2024).
The bottom lineEn corto

Use ML where it beats the simple baseline on held-out data — everywhere else, keep the simple model.

Usa ML donde supera a la línea base simple en datos de validación; en todo lo demás, conserva el modelo simple.

All D16 componentsTodos los componentes de D16D16 artifactsArtifacts de D16SCRA