D03 · L3 · 05 — Maintenance & Asset ReliabilityMantenimiento y Confiabilidad de Activos

MTBF & reliability KPI frameworkMTBF y marco de KPIs de confiabilidad

The MTBF reported as a single aggregate number, without Weibull decomposition by failure mode and criticality, is an average that does not diagnose — and averages do not improve, diagnoses do. The same data set produces no improvement when reported as aggregate MTBF and 30–60% critical-asset MTBF improvement when reported as decomposed metrics with Weibull characterization.

El MTBF reportado como un número agregado único, sin descomposición Weibull por modo de falla y criticidad, es un promedio que no diagnostica — y los promedios no mejoran, los diagnósticos sí. El mismo conjunto de datos no produce mejora cuando se reporta como MTBF agregado y produce 30–60% de mejora en MTBF de activos críticos cuando se reporta como métricas descompuestas con caracterización Weibull.

01What it isQué es

The reliability KPI framework is the disciplined set of metrics that diagnose equipment reliability — MTBF (mean time between failures), MTTR (mean time to repair), availability, and the underlying failure-mode decomposition that converts the aggregate metrics into actionable diagnoses. The Weibull analysis underlying the framework characterizes whether failures are infant-mortality (β < 1), random (β ≈ 1), or wear-out (β > 1), with each pattern requiring a fundamentally different maintenance strategy. Aggregate metrics without decomposition are summary statistics; decomposed metrics with Weibull characterization are the diagnostic apparatus that drives reliability improvement.

El marco de KPIs de confiabilidad es el conjunto disciplinado de métricas que diagnostica la confiabilidad del equipo — MTBF (tiempo medio entre fallas), MTTR (tiempo medio de reparación), disponibilidad y la descomposición subyacente por modo de falla que convierte las métricas agregadas en diagnósticos accionables. El análisis Weibull subyacente al marco caracteriza si las fallas son de mortalidad infantil (β < 1), aleatorias (β ≈ 1) o por desgaste (β > 1), con cada patrón requiriendo una estrategia de mantenimiento fundamentalmente diferente. Las métricas agregadas sin descomposición son estadísticos de resumen; las métricas descompuestas con caracterización Weibull son el aparato diagnóstico que impulsa la mejora de confiabilidad.

02Why it mattersPor qué importa

The reliability KPI framework is the most universally reported and most consistently mis-used set of operational metrics in industrial maintenance. The dominant failure mode is MTBF reported as a single aggregate number — "MTBF is 480 hours" — without decomposition by failure mode, by asset criticality, or by Weibull shape parameter. The aggregate hides three different reliability problems with three different strategic remedies, and the maintenance organization attacks the average instead of the underlying patterns. The international standard for reliability data collection in industrial operations is explicit on the decomposition requirement (ISO 14224:2016 — international standard, "Petroleum, petrochemical and natural gas industries — Collection and exchange of reliability and maintenance data for equipment"): reliability data must be captured and reported with failure-mode classification, equipment-level granularity, and time-to-failure distributions that support Weibull analysis. Industry data confirms the asymmetry — operations that decompose MTBF by failure mode and characterize failures with Weibull analysis typically deliver 30–60% improvement in critical-asset MTBF within 18 months; operations that report aggregate MTBF without decomposition show no measurable improvement despite the same maintenance investment. The difference is not effort; it is whether the metrics support diagnosis.

El marco de KPIs de confiabilidad es el conjunto más universalmente reportado y más consistentemente mal usado de métricas operativas en mantenimiento industrial. El modo de falla dominante es MTBF reportado como un solo número agregado — "MTBF es 480 horas" — sin descomposición por modo de falla, por criticidad de activo, o por parámetro de forma Weibull. El agregado esconde tres problemas diferentes de confiabilidad con tres remedios estratégicos diferentes, y la organización de mantenimiento ataca al promedio en lugar de a los patrones subyacentes. El estándar internacional para colección de datos de confiabilidad en operaciones industriales es explícito sobre el requisito de descomposición (ISO 14224:2016 — estándar internacional, "Petroleum, petrochemical and natural gas industries — Collection and exchange of reliability and maintenance data for equipment"): los datos de confiabilidad deben capturarse y reportarse con clasificación por modo de falla, granularidad a nivel equipo y distribuciones tiempo-a-falla que soporten análisis Weibull. Los datos de industria confirman la asimetría — las operaciones que descomponen MTBF por modo de falla y caracterizan las fallas con análisis Weibull típicamente entregan mejora del 30 al 60% en MTBF de activos críticos dentro de 18 meses; las operaciones que reportan MTBF agregado sin descomposición no muestran mejora medible a pesar de la misma inversión de mantenimiento. La diferencia no es el esfuerzo; es si las métricas soportan el diagnóstico.

03How it is doneCómo se hace

1
Capture failure data at the failure-mode level — not at the asset-failed level. A pump that fails because of a bearing problem, a pump that fails because of a seal problem, and a pump that fails because of an impeller problem are three different events with three different causes and three different countermeasures. Recording all three as "pump failure" destroys the diagnostic information. The CMMS work-order completion has to capture failure mode using a standardized taxonomy (ISO 14224 provides one for process industries; equivalent standards exist for other industries) so that aggregate metrics can be decomposed downstream.
2
Run Weibull analysis on the failure data — and let the shape parameter drive the maintenance strategy. Weibull shape parameter (β) less than 1: infant-mortality failures, the strategy is better installation/commissioning and stricter QC at startup. β approximately 1: random failures, the strategy is condition-based monitoring and run-to-failure where consequence permits (scheduled replacement does not help because failure timing is unpredictable). β greater than 1: wear-out failures, the strategy is scheduled replacement before the wear-out distribution kicks in. Plants that apply scheduled replacement to random failures waste resources; plants that wait for wear-out failures to manifest catch them at the wrong end of the cost curve.
3
Decompose MTBF by asset criticality — the average across all assets is meaningless if it hides how critical assets are performing. An operation with 340 assets at average MTBF of 480 hours might have 22 critical assets at 220 hours MTBF and 318 non-critical assets at 510 hours MTBF — the average looks acceptable while the critical positions are failing every 9 days. Reporting MTBF by criticality tier (critical / important / standard) exposes where the reliability problem actually lives; reporting aggregate MTBF obscures it.
4
Report MTBF, MTTR, and availability together — none of them alone tells the story. MTBF measures failure frequency, MTTR measures repair time, availability = MTBF / (MTBF + MTTR) integrates both. A plant with MTBF 600 hours and MTTR 60 hours has 91% availability; a plant with MTBF 800 hours and MTTR 200 hours has 80% availability despite the better MTBF. Improving MTBF while ignoring MTTR is the most common organizational dysfunction in reliability programs because MTBF improvement is what reliability engineers focus on and MTTR is what maintenance technicians own — the two functions optimize separately and produce sub-optimal availability.
5
Use survival analysis and reliability growth tracking — not just point-in-time MTBF. A plant's MTBF this quarter compared to last quarter is a comparison of two estimates each based on small samples of failures; the noise frequently exceeds the signal. The right view is survival curves over time (showing how the failure-time distribution is shifting), reliability growth tracking on specific failure modes after countermeasures, and confidence intervals around MTBF estimates. Plants that report MTBF as a single number with no uncertainty estimate routinely chase noise; plants that report distributions with confidence intervals make decisions on real signal.
6
Govern the reliability KPI framework jointly between reliability engineering and operations — the metrics belong to both functions or to neither. The most common organizational pathology is reliability engineering owning the metrics and operations not consulting them in production decisions. The structural fix is monthly reliability review with operations leadership where the failure-mode decomposition, the Weibull characterization, and the action items get reviewed — not as a maintenance report but as an operational diagnostic. When operations leadership engages with the KPI framework, the framework drives decisions; when only reliability engineering looks at the data, it produces reports that nobody acts on.
Worked example — illustrativeA chemicals manufacturer (1 plant, 340 production assets including reactors, distillation columns, heat exchangers, pumps, compressors) reports plant-level aggregate MTBF = 480 hours monthly. The reliability program has been "improving MTBF" for three years with limited results. Weibull decomposition by failure mode and asset reveals the structure the aggregate was hiding: 73% of total failures concentrate in 22 critical assets (out of 340); within those 22 critical assets, failure modes distribute as 40% wear-out (β = 3.2 — clear wear-out signature, scheduled replacement is the right strategy), 31% random (β = 1.0 — condition-based monitoring is the right strategy), 29% infant-mortality (β = 0.6 — installation and commissioning quality is the issue). The aggregate MTBF of 480 hours was simultaneously the average of failure rates that needed three completely different strategies. The implementation: (1) scheduled replacement program on the top 8 wear-out items (bearings, seals, gaskets on critical positions) before the wear-out distribution kicks in; (2) installation-procedure standardization with stricter QC at commissioning for the 29% of failures showing infant-mortality signature; (3) condition-based monitoring deployed on the random-failure items where prediction is feasible; (4) monthly reliability review with operations leadership where decomposed metrics drive specific action items. Results 16 months later: aggregate MTBF 480 → 720 hours (+50%), but more importantly: unplanned failures on critical assets reduced 71%, downtime cost reduced 58%, MTBF improvement concentrated where the operation actually needed it. The aggregate number improvement is real but secondary; the structural improvement came from the decomposition that the aggregate had been hiding.
1
Captura datos de falla a nivel de modo de falla — no a nivel activo-falló. Una bomba que falla por un problema de cojinete, una bomba que falla por un problema de sello y una bomba que falla por un problema de impulsor son tres eventos diferentes con tres causas diferentes y tres contramedidas diferentes. Registrar las tres como "falla de bomba" destruye la información diagnóstica. La finalización de la orden de trabajo en CMMS tiene que capturar el modo de falla usando una taxonomía estandarizada (ISO 14224 provee una para industrias de proceso; existen estándares equivalentes para otras industrias) para que las métricas agregadas puedan ser descompuestas aguas abajo.
2
Corre análisis Weibull sobre los datos de falla — y deja que el parámetro de forma impulse la estrategia de mantenimiento. Parámetro de forma Weibull (β) menor que 1: fallas de mortalidad infantil, la estrategia es mejor instalación/puesta en marcha y QC más estricto al arranque. β aproximadamente 1: fallas aleatorias, la estrategia es monitoreo basado en condición y run-to-failure donde la consecuencia lo permite (el reemplazo programado no ayuda porque el timing de falla es impredecible). β mayor que 1: fallas por desgaste, la estrategia es reemplazo programado antes de que la distribución de desgaste se active. Las plantas que aplican reemplazo programado a fallas aleatorias desperdician recursos; las plantas que esperan a que las fallas por desgaste se manifiesten las atrapan en el extremo equivocado de la curva de costo.
3
Descompón MTBF por criticidad de activo — el promedio a través de todos los activos no tiene sentido si esconde cómo los activos críticos están desempeñando. Una operación con 340 activos a MTBF promedio de 480 horas podría tener 22 activos críticos a MTBF de 220 horas y 318 activos no críticos a MTBF de 510 horas — el promedio se ve aceptable mientras las posiciones críticas están fallando cada 9 días. Reportar MTBF por nivel de criticidad (crítico / importante / estándar) expone dónde el problema de confiabilidad realmente vive; reportar MTBF agregado lo oculta.
4
Reporta MTBF, MTTR y disponibilidad juntos — ninguno por sí solo cuenta la historia. MTBF mide frecuencia de falla, MTTR mide tiempo de reparación, disponibilidad = MTBF / (MTBF + MTTR) integra ambos. Una planta con MTBF de 600 horas y MTTR de 60 horas tiene 91% de disponibilidad; una planta con MTBF de 800 horas y MTTR de 200 horas tiene 80% de disponibilidad a pesar del mejor MTBF. Mejorar MTBF mientras se ignora MTTR es la disfunción organizacional más común en programas de confiabilidad porque la mejora de MTBF es en lo que los ingenieros de confiabilidad se enfocan y MTTR es lo que los técnicos de mantenimiento dueñan — las dos funciones optimizan por separado y producen disponibilidad sub-óptima.
5
Usa análisis de supervivencia y tracking de crecimiento de confiabilidad — no solo MTBF point-in-time. El MTBF de una planta este trimestre comparado con el último trimestre es una comparación de dos estimados cada uno basado en muestras pequeñas de fallas; el ruido frecuentemente excede la señal. La vista correcta es curvas de supervivencia en el tiempo (mostrando cómo la distribución de tiempo-a-falla se está moviendo), tracking de crecimiento de confiabilidad en modos de falla específicos después de contramedidas e intervalos de confianza alrededor de los estimados de MTBF. Las plantas que reportan MTBF como un solo número sin estimado de incertidumbre rutinariamente persiguen ruido; las plantas que reportan distribuciones con intervalos de confianza toman decisiones sobre señal real.
6
Goberna el marco de KPIs de confiabilidad conjuntamente entre ingeniería de confiabilidad y operaciones — las métricas pertenecen a ambas funciones o a ninguna. La patología organizacional más común es ingeniería de confiabilidad dueñando las métricas y operaciones no consultándolas en decisiones de producción. El arreglo estructural es revisión mensual de confiabilidad con liderazgo de operaciones donde la descomposición por modo de falla, la caracterización Weibull y los action items se revisan — no como un reporte de mantenimiento sino como un diagnóstico operativo. Cuando el liderazgo de operaciones se involucra con el marco de KPI, el marco impulsa decisiones; cuando solo ingeniería de confiabilidad mira los datos, produce reportes sobre los que nadie actúa.
Ejemplo trabajado — ilustrativoUn manufacturero de químicos (1 planta, 340 activos de producción incluyendo reactores, columnas de destilación, intercambiadores de calor, bombas, compresores) reporta a nivel planta MTBF agregado = 480 horas mensualmente. El programa de confiabilidad ha estado "mejorando MTBF" por tres años con resultados limitados. La descomposición Weibull por modo de falla y activo revela la estructura que el agregado estaba escondiendo: el 73% de las fallas totales se concentra en 22 activos críticos (de 340); dentro de esos 22 activos críticos, los modos de falla se distribuyen como 40% por desgaste (β = 3.2 — signatura clara de desgaste, el reemplazo programado es la estrategia correcta), 31% aleatorios (β = 1.0 — el monitoreo basado en condición es la estrategia correcta), 29% mortalidad infantil (β = 0.6 — la calidad de instalación y puesta en marcha es el asunto). El MTBF agregado de 480 horas era simultáneamente el promedio de tasas de falla que necesitaban tres estrategias completamente diferentes. La implementación: (1) programa de reemplazo programado en los top 8 items por desgaste (cojinetes, sellos, empaques en posiciones críticas) antes de que la distribución de desgaste se active; (2) estandarización del procedimiento de instalación con QC más estricto al comisionamiento para el 29% de fallas que muestran signatura de mortalidad infantil; (3) monitoreo basado en condición desplegado en los items de falla aleatoria donde la predicción es factible; (4) revisión mensual de confiabilidad con el liderazgo de operaciones donde las métricas descompuestas impulsan action items específicos. Resultados 16 meses después: MTBF agregado 480 → 720 horas (+50%), pero más importante: las fallas no planeadas en activos críticos reducidas en 71%, costo de paro reducido en 58%, mejora de MTBF concentrada donde la operación realmente la necesitaba. La mejora del número agregado es real pero secundaria; la mejora estructural vino de la descomposición que el agregado había estado escondiendo.

04In practiceEn la práctica

📊Decompose MTBF by failure mode using ISO 14224 taxonomy›
Aggregate MTBF hides three different reliability problems with three different strategic remedies. The standardized failure-mode taxonomy (ISO 14224:2016 — international standard) is the data-collection structure that makes decomposition possible; without it the data exists but cannot be analyzed.
📈Let the Weibull shape parameter drive the maintenance strategy›
β < 1 (infant mortality) → installation quality is the problem, not maintenance frequency. β ≈ 1 (random) → condition monitoring is appropriate; time-based maintenance wastes effort. β > 1 (wear-out) → scheduled replacement before the wear-out zone. Same MTBF, three different strategies.
🔍Decompose by asset criticality — critical-asset performance hides in the average›
A plant-wide MTBF of 480 hours can mean every asset performs identically or that critical assets fail every 96 hours while non-critical assets last 2,400. Same average, radically different operations. Critical-asset MTBF is the metric that drives intervention; aggregate MTBF is the metric that goes in the report.
🔄Monthly joint review: reliability engineering + operations management›
Quarterly Weibull analyses produced by reliability engineering that operations does not read; monthly maintenance decisions made by operations that reliability does not influence — the metric framework dies in the gap. Monthly joint review with explicit translation from failure-mode/Weibull findings to budget and strategy decisions is the structural fix.
📊Descompón MTBF por modo de falla usando la taxonomía ISO 14224›
El MTBF agregado esconde tres problemas distintos de confiabilidad con tres remedios estratégicos distintos. La taxonomía estandarizada de modos de falla (ISO 14224:2016 — estándar internacional) es la estructura de captura de datos que hace posible la descomposición; sin esto los datos existen pero no se pueden analizar.
📈Deja que el parámetro de forma Weibull maneje la estrategia de mantenimiento›
β < 1 (mortalidad infantil) → la calidad de instalación es el problema, no la frecuencia de mantenimiento. β ≈ 1 (aleatoria) → el monitoreo de condición es apropiado; el mantenimiento basado en tiempo desperdicia esfuerzo. β > 1 (desgaste) → reemplazo programado antes de la zona de desgaste. Mismo MTBF, tres estrategias diferentes.
🔍Descompón por criticidad de activo — el desempeño de activos críticos se esconde en el promedio›
Un MTBF a nivel planta de 480 horas puede significar que cada activo se desempeña idénticamente o que activos críticos fallan cada 96 horas mientras los no críticos duran 2,400. Mismo promedio, operaciones radicalmente diferentes. El MTBF de activos críticos es la métrica que dispara intervención; el MTBF agregado es la métrica que va en el reporte.
🔄Revisión mensual conjunta: ingeniería de confiabilidad + gerencia de operaciones›
Análisis Weibull trimestrales producidos por ingeniería de confiabilidad que operaciones no lee; decisiones mensuales de mantenimiento tomadas por operaciones que confiabilidad no influencia — el marco de métricas muere en la brecha. La revisión mensual conjunta con traducción explícita desde los hallazgos de modo-de-falla/Weibull a decisiones de presupuesto y estrategia es el arreglo estructural.

05What you would useQué se usa

📌 RELIABILITY KPI & WEIBULL ANALYSIS
🟦ReliaSoft Weibull++ / Synthesis Platform (Hottinger) / Reliasoft RGA›
Dedicated reliability engineering platforms with native Weibull analysis, reliability growth tracking, survival analysis, FRACAS integration, and ISO 14224-aligned data structures; the standard tool set for reliability engineering functions in process and discrete manufacturing (Hottinger Brüel & Kjær — vendor).
🟩IBM Maximo Reliability / GE Vernova APM / AVEVA Asset Performance Management›
Enterprise asset performance management platforms that integrate reliability analytics directly with the CMMS/EAM operational data, producing decomposed KPIs as a native output rather than a separate analytical artifact (IBM — vendor; GE Vernova — vendor; AVEVA — vendor).
🟥Minitab / JMP (SAS) with Weibull modules + structured CMMS data extraction›
General-purpose statistical platforms with strong reliability-analysis capability, paired with structured data extraction from the operation's CMMS; the right fit when reliability engineering has statistical depth in-house and the platform purchase decision goes to general statistical tools (Minitab — vendor; SAS Institute — vendor).
⬜R or Python (with reliability/survival packages) + structured CMMS export + monthly joint review›
For operations with data-engineering capability — open-source statistical environments (R with the survival package, Python with lifelines and SciPy), structured monthly export from CMMS into the analytical environment, joint reliability + operations review of the decomposed outputs. The lowest-tech option produces the deepest analytical sophistication when the in-house capability is real.
📌 KPI DE CONFIABILIDAD Y ANÁLISIS WEIBULL
🟦ReliaSoft Weibull++ / Synthesis Platform (Hottinger) / Reliasoft RGA›
Plataformas dedicadas de ingeniería de confiabilidad con análisis Weibull nativo, tracking de crecimiento de confiabilidad, análisis de supervivencia, integración FRACAS y estructuras de datos alineadas a ISO 14224; el set de herramientas estándar para funciones de ingeniería de confiabilidad en manufactura de proceso y discreta (Hottinger Brüel & Kjær — vendor).
🟩IBM Maximo Reliability / GE Vernova APM / AVEVA Asset Performance Management›
Plataformas empresariales de asset performance management que integran la analítica de confiabilidad directamente con los datos operativos del CMMS/EAM, produciendo KPIs descompuestos como output nativo en lugar de artefacto analítico separado (IBM — vendor; GE Vernova — vendor; AVEVA — vendor).
🟥Minitab / JMP (SAS) con módulos Weibull + extracción estructurada de datos CMMS›
Plataformas estadísticas de propósito general con capacidad robusta de análisis de confiabilidad, emparejadas con extracción estructurada de datos del CMMS de la operación; el fit correcto cuando ingeniería de confiabilidad tiene profundidad estadística in-house y la decisión de compra de plataforma va a herramientas estadísticas generales (Minitab — vendor; SAS Institute — vendor).
⬜R o Python (con paquetes de confiabilidad/supervivencia) + exportación estructurada de CMMS + revisión conjunta mensual›
Para operaciones con capacidad de ingeniería de datos — ambientes estadísticos open-source (R con el paquete survival, Python con lifelines y SciPy), exportación mensual estructurada del CMMS al ambiente analítico, revisión conjunta confiabilidad + operaciones de los outputs descompuestos. La opción de menor tecnología produce la sofisticación analítica más profunda cuando la capacidad in-house es real.
The bottom lineEn corto

The MTBF reported as a single aggregate number, without Weibull decomposition by failure mode and criticality, is an average that does not diagnose — and averages do not improve, diagnoses do. Capture failure data at the failure-mode level using a standardized taxonomy, run Weibull analysis and let the shape parameter drive the maintenance strategy, decompose MTBF by asset criticality so critical-asset performance is not hidden in the average, report MTBF + MTTR + availability together, use survival analysis and reliability growth tracking instead of point-in-time MTBF, and govern the framework jointly between reliability engineering and operations. The same data set produces no improvement when reported as aggregate MTBF and 30–60% critical-asset MTBF improvement when reported as decomposed metrics with Weibull characterization — the difference is structural, and it lives in whether the metrics support diagnosis or just summary.

El MTBF reportado como un solo número agregado, sin descomposición Weibull por modo de falla y criticidad, es un promedio que no diagnostica — y los promedios no mejoran, los diagnósticos sí. Captura datos de falla a nivel de modo de falla usando una taxonomía estandarizada, corre análisis Weibull y deja que el parámetro de forma impulse la estrategia de mantenimiento, descompón MTBF por criticidad de activo para que el desempeño de activos críticos no se esconda en el promedio, reporta MTBF + MTTR + disponibilidad juntos, usa análisis de supervivencia y tracking de crecimiento de confiabilidad en lugar de MTBF point-in-time, y goberna el marco conjuntamente entre ingeniería de confiabilidad y operaciones. El mismo conjunto de datos produce cero mejora cuando se reporta como MTBF agregado y del 30 al 60% de mejora de MTBF en activos críticos cuando se reporta como métricas descompuestas con caracterización Weibull — la diferencia es estructural, y vive en si las métricas soportan el diagnóstico o solo el resumen.

All D03 componentsTodos los componentes de D03D03 artifactsArtifacts de D03SCRA