D12 · L3 · 01 — L2 · Supply Chain Data Architecture & InfrastructureL2 · Arquitectura e Infraestructura de Datos de la Cadena

Data lakes, data warehouses & lakehouse architecture for supply chainData lakes, data warehouses y arquitectura lakehouse para SC

Supply chain data without the right architecture cannot inform decisions in time.

El dato de SC sin arquitectura de datos correcta no puede usarse para decisiones a tiempo.

01What it isQué es

A supply chain data architecture defines where operational, IoT and external data land, how they are modeled and how fast they reach planners and models; the lakehouse combines the cheap, flexible storage of a data lake with the governed, queryable tables of a data warehouse.

La arquitectura de datos de supply chain define dónde aterrizan los datos operativos, de IoT y externos, cómo se modelan y qué tan rápido llegan a planeadores y modelos; el lakehouse combina el almacenamiento barato y flexible de un data lake con las tablas gobernadas y consultables de un data warehouse.

02Why it mattersPor qué importa

Forecasts, inventory policies and control towers are only as timely as the data feeding them, and most companies still stitch ERP, WMS and TMS extracts together by hand. Data science and predictive analytics are expected to reshape supply chain design and management, but only on top of integrated, reliable data (Waller and Fawcett, 2013 — Journal of Business Logistics). The lakehouse was proposed precisely to remove the two-tier lake-plus-warehouse copy that delays and duplicates data (Armbrust, Ghodsi, Xin and Zaharia, 2021 — CIDR).

Los pronósticos, las políticas de inventario y las torres de control solo son tan oportunos como los datos que los alimentan, y la mayoría de las empresas todavía une a mano extracciones de ERP, WMS y TMS. Se espera que la ciencia de datos y la analítica predictiva transformen el diseño y la gestión de la cadena de suministro, pero solo sobre datos integrados y confiables (Waller and Fawcett, 2013 — Journal of Business Logistics). El lakehouse se propuso precisamente para eliminar la doble copia lake-más-warehouse que retrasa y duplica los datos (Armbrust, Ghodsi, Xin and Zaharia, 2021 — CIDR).

03How it is doneCómo se hace

1
Inventory sources and latencies. List every system feeding planning and execution, with its owner, refresh frequency and the decision it supports.
2
Land once, model in layers. Ingest raw data into open-format tables and refine it into clean, conformed and business-ready layers instead of copying it per report.
3
Set SLAs per use case. Agree freshness and reliability targets for each decision — daily for S&OP, minutes for cold chain alerts — and monitor them.
1
Inventaría fuentes y latencias. Lista cada sistema que alimenta la planeación y la ejecución, con su dueño, frecuencia de actualización y la decisión que soporta.
2
Carga una vez, modela por capas. Ingiere los datos crudos en tablas de formato abierto y refínalos en capas limpias, conformadas y listas para el negocio, en lugar de copiarlos por reporte.
3
Fija SLA por caso de uso. Acuerda metas de frescura y confiabilidad para cada decisión —diaria para S&OP, minutos para alertas de cadena de frío— y monitoréalas.

04The concept in depthEl concepto a fondo

🏗️Supply chain data architecture: from operational data to analytical decisions›
Modern supply chains generate data across all layers — transactional (ERP, WMS, TMS), real-time operational (IoT, sensors, tracking events), and external (weather, retailer POS, market signals). The supply chain data architecture defines how this data is captured, stored, transformed, and consumed to generate decisions.
📊The 3 data storage paradigms for supply chain›
Data Warehouse (DW): structured, modeled storage for reporting and BI. Data is transformed before storage (schema-on-write). High query performance. Ideal for stable operational KPIs. Examples: Snowflake, BigQuery, Redshift. Data Lake: raw format storage at low cost. Data is transformed at query time (schema-on-read). High flexibility. Ideal for ML and data exploration. Examples: AWS S3, Azure Data Lake Storage, GCS. Lakehouse: the combination — low-cost raw storage of the data lake with the analytical capabilities of the data warehouse, increasingly the default for new analytics platforms. Examples: Databricks, Snowflake with Iceberg tables, Microsoft Fabric; built on open table formats such as Delta Lake and Apache Iceberg.
🔢Supply chain data sources and their characteristics›
ERP (SAP S/4HANA, Oracle, Microsoft Dynamics): high-quality transactional data but high update latency (daily batch). WMS (Manhattan, SAP EWM): real-time or near-real-time inventory and movement data. TMS (Oracle TMS, SAP TM): transport and route data. IoT/sensors: high-frequency, high-volume data (temperature, vibration, level). External sources (POS, weather, social): variable quality and heterogeneous formats.
🏆Intermediate vs. Advanced›
Intermediate: consumes available data in reporting systems and dashboards for day-to-day operational decisions.

Advanced: designs the supply chain data architecture; manages multi-source data integration; implements the lakehouse for ML and BI use cases.
🏗️Arquitectura de datos de supply chain: del dato operativo a la decisión analítica›
Las cadenas de suministro modernas generan datos en todas sus capas: transaccionales (ERP, WMS, TMS), operativos en tiempo real (IoT, sensores, eventos de rastreo) y externos (clima, POS de retailers, señales de mercado). La arquitectura de datos de supply chain define cómo se capturan, almacenan, transforman y consumen esos datos para generar decisiones.
📊Los 3 paradigmas de almacenamiento de datos para supply chain›
Data Warehouse (DW): almacenamiento estructurado y modelado para reporteo y BI. Los datos se transforman antes de almacenarse (schema-on-write). Alto desempeño en consultas. Ideal para KPI operativos estables. Ejemplos: Snowflake, BigQuery, Redshift. Data Lake: almacenamiento en formato crudo a bajo costo. Los datos se transforman al momento de consultarlos (schema-on-read). Alta flexibilidad. Ideal para ML y exploración de datos. Ejemplos: AWS S3, Azure Data Lake Storage, GCS. Lakehouse: la combinación del almacenamiento crudo de bajo costo del data lake con las capacidades analíticas del data warehouse; cada vez más es la opción por defecto en nuevas plataformas analíticas. Ejemplos: Databricks, Snowflake con tablas Iceberg, Microsoft Fabric; se construyen sobre formatos de tabla abiertos como Delta Lake y Apache Iceberg.
🔢Fuentes de datos de supply chain y sus características›
ERP (SAP S/4HANA, Oracle, Microsoft Dynamics): datos transaccionales de alta calidad, pero con alta latencia de actualización (batch diario). WMS (Manhattan, SAP EWM): datos de inventario y movimientos en tiempo real o casi real. TMS (Oracle TMS, SAP TM): datos de transporte y rutas. IoT/sensores: datos de alta frecuencia y alto volumen (temperatura, vibración, nivel). Fuentes externas (POS, clima, redes sociales): calidad variable y formatos heterogéneos.
🏆Intermedio vs. Avanzado›
Intermedio: consume los datos disponibles en sistemas de reporteo y dashboards para decisiones operativas del día a día.

Avanzado: diseña la arquitectura de datos de supply chain; gestiona la integración de datos de múltiples fuentes; implementa el lakehouse para casos de uso de ML y BI.

05In practiceEn la práctica

🏗️Lakehouse is the right data architecture paradigm for most supply chain companies today›
The combination of data lake low-cost storage with warehouse analytical capabilities is the most flexible and lowest-cost architecture for supply chain use cases (BI + ML + real-time).
🔢Unify existing data sources before building new analytical capabilities›
Most of the value of the data architecture comes from integrating existing data into a unified repository — not from adding new data sources.
🔗Define latency SLAs by use case — not all data needs real-time updates›
A monthly planning inventory report can have 1-day latency. A cold chain temperature rupture alert needs <5-minute latency. The latency SLA must be defined per use case — not generically.
📊Manage data lineage from day 1 — knowing where data comes from is critical for model trust›
Data lineage (the traceability of each data point from its source to the model or dashboard) is the prerequisite of analytics trust. Without data lineage, nobody can explain why the model recommends what it does.
🏗️El lakehouse es el paradigma de arquitectura de datos adecuado para la mayoría de las empresas de supply chain hoy›
La combinación del almacenamiento de bajo costo del data lake con las capacidades analíticas del warehouse es la arquitectura más flexible y de menor costo para los casos de uso de supply chain (BI + ML + tiempo real).
🔢Unifica las fuentes de datos existentes antes de construir nuevas capacidades analíticas›
La mayor parte del valor de la arquitectura de datos proviene de integrar los datos existentes en un repositorio unificado, no de agregar nuevas fuentes.
🔗Define SLA de latencia por caso de uso: no todos los datos necesitan actualizarse en tiempo real›
Un reporte mensual de inventario para planeación puede tolerar 1 día de latencia. Una alerta de ruptura de temperatura en cadena de frío necesita latencia menor a 5 minutos. El SLA de latencia debe definirse por caso de uso, no de forma genérica.
📊Gestiona el linaje de datos desde el día 1: saber de dónde viene el dato es crítico para confiar en el modelo›
El linaje de datos (data lineage: la trazabilidad de cada dato desde su fuente hasta el modelo o dashboard) es el prerrequisito de la confianza en la analítica. Sin linaje, nadie puede explicar por qué el modelo recomienda lo que recomienda.

06Illustrative caseCaso ilustrativo

Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Illustrative case: Lakehouse implementation for supply chain analytics — manufacturing company, migration from multiple silos
The company has data spread across 8 unintegrated systems: ERP (SAP), WMS (Manhattan), TMS (Blue Yonder), Quality (SAP QM), Suppliers (portal), Weather (API), retailer POS (weekly batch), and planners’ Excel files.
Data sourceLatency before lakehouseLatency with lakehouse
ERP (SAP S/4HANA) — inventory and order transactionsDaily batch · Available at 7am next dayNear-real-time (15 min) via SAP CDC
WMS (Manhattan) — warehouse movementsNear-real-time but siloed · No ERP integrationNear-real-time integrated · Unified ERP+WMS inventory visibility
TMS + IoT sensors on shipments — temperature and GPSBatch at route close · No in-transit alertsReal-time streaming · Automatic temperature excursion alerts
External sources (weather, retailer POS)Manual · Planner downloads and loads into ExcelAutomated · Available in lakehouse at 5am
Result: The lakehouse unified 8 silos into a single repository with 15-minute latency for ERP/WMS data. First analytics use case enabled: the forecast model that previously required 4 hours of manual data preparation now runs automatically. Forecast MAPE improved from 22% to 16% in 3 months with real-time POS data access.
Illustrative case built from typical industry values — not data from a specific company.Caso ilustrativo construido con valores típicos de la industria — no son datos de una empresa específica.
Caso ilustrativo: implementación de lakehouse para analítica de supply chain — empresa manufacturera, migración desde múltiples silos
La empresa tiene datos dispersos en 8 sistemas no integrados: ERP (SAP), WMS (Manhattan), TMS (Blue Yonder), Calidad (SAP QM), Proveedores (portal), Clima (API), POS de retailers (batch semanal) y archivos de Excel de los planeadores.
Fuente de datosLatencia antes del lakehouseLatencia con lakehouse
ERP (SAP S/4HANA) — transacciones de inventario y pedidosBatch diario · Disponible a las 7 a.m. del día siguienteCasi en tiempo real (15 min) vía CDC de SAP
WMS (Manhattan) — movimientos de almacénCasi en tiempo real pero aislado · Sin integración con el ERPCasi en tiempo real e integrado · Visibilidad unificada de inventario ERP+WMS
TMS + sensores IoT en embarques — temperatura y GPSBatch al cierre de ruta · Sin alertas en tránsitoStreaming en tiempo real · Alertas automáticas de excursión de temperatura
Fuentes externas (clima, POS de retailers)Manual · El planeador descarga y carga en ExcelAutomatizado · Disponible en el lakehouse a las 5 a.m.
Resultado: El lakehouse unificó 8 silos en un solo repositorio con latencia de 15 minutos para los datos de ERP/WMS. Primer caso de uso analítico habilitado: el modelo de pronóstico que antes requería 4 horas de preparación manual de datos ahora corre automáticamente. El MAPE del pronóstico mejoró de 22% a 16% en 3 meses gracias al acceso a datos de POS en tiempo real.

07How it is measuredCómo se mide

🏗️Data Freshness % (% of data sources available within the target latency SLA)›
Data Freshness % (% of data sources available within the target latency SLA)
(Data sources updated within the target latency SLA / Total lakehouse data sources) × 100
Benchmark: >90% of data sources available within latency SLA · Critical sources (ERP, WMS) with SLA <1 hour
⚠️ A supply chain dashboard built on data with 24-hour latency cannot support same-day operational decisions. Data latency is the first constraint of analytical utility.
📊Data Pipeline Reliability % (% uptime of data pipelines)›
Data Pipeline Reliability % (% uptime of data pipelines)
(Data pipeline uptime hours / Total period hours) × 100
Benchmark: >99.5% uptime for critical supply chain data pipelines
🔑 A data pipeline that fails 2% of the time generates 7 days of missing or stale data per year — which can cause ML models or critical dashboards to make decisions based on incorrect data.
🏗️Data Freshness % (% de fuentes de datos disponibles dentro del SLA de latencia objetivo)›
Data Freshness % (% de fuentes de datos disponibles dentro del SLA de latencia objetivo)
(Fuentes de datos actualizadas dentro del SLA de latencia objetivo / Total de fuentes de datos del lakehouse) × 100
Benchmark: >90% de las fuentes disponibles dentro del SLA de latencia · Fuentes críticas (ERP, WMS) con SLA <1 hora
⚠️ Un dashboard de supply chain construido sobre datos con 24 horas de latencia no puede soportar decisiones operativas del mismo día. La latencia del dato es la primera restricción de su utilidad analítica.
📊Data Pipeline Reliability % (% de disponibilidad de los pipelines de datos)›
Data Pipeline Reliability % (% de disponibilidad de los pipelines de datos)
(Horas de disponibilidad del pipeline / Total de horas del periodo) × 100
Benchmark: >99.5% de disponibilidad para los pipelines de datos críticos de supply chain
🔑 Un pipeline que falla 2% del tiempo genera 7 días al año de datos faltantes o desactualizados, lo que puede llevar a modelos de ML o dashboards críticos a decidir con datos incorrectos.

08What you would useQué se usa

📌 Data Platform
🟦Databricks Lakehouse / Delta Lake›
Module: Unified Data Platform for Supply Chain Analytics

Databricks is the reference lakehouse platform for supply chain analytics at scale. Combines streaming, batch, ML, and SQL analytics in a single platform.
🟦Snowflake + Fivetran›
Module: Cloud Data Warehouse + ELT Pipelines

Snowflake as the cloud data warehouse with Fivetran for pipeline automation from SAP, Oracle, and external sources.
📌 Plataforma de datos
🟦Databricks Lakehouse / Delta Lake›
Módulo: Plataforma unificada de datos para analítica de supply chain

Databricks es la plataforma lakehouse de referencia para analítica de supply chain a escala. Combina streaming, batch, ML y analítica SQL en una sola plataforma.
🟦Snowflake + Fivetran›
Módulo: Data warehouse en la nube + pipelines ELT

Snowflake como data warehouse en la nube, con Fivetran para automatizar los pipelines desde SAP, Oracle y fuentes externas.
The bottom lineEn corto

Integrate the data you already have, on one platform, at the speed each decision needs — before buying anything new.

Integra los datos que ya tienes, en una sola plataforma, a la velocidad que cada decisión necesita, antes de comprar algo nuevo.

All D12 componentsTodos los componentes de D12D12 artifactsArtifacts de D12SCRA