EP242 – Sin Datos, Eres Solo Otra Persona Con Una Opinión
El mejor modelo de regresión que Juan Navarro ha visto tenía un R² de 0,96, y fue también el que más dinero le costó a su empresa. En este episodio conocerás las 6 verificaciones esenciales que todo modelo debe pasar antes de tomar decisiones de calidad, explicadas sin tecnicismos, con ejemplos simples y usando la analogía de un piloto comercial que jamás despega sin su checklist de prevuelo. Porque un R² alto puede esconder un problema serio.
#AnálisisDeRegresión #GestiónDeCalidad #SixSigma #EstadísticaIndustrial #DataAnalytics #LeanSixSigma #Calidad #MejoraContinua #AdvancedQualityPrograms #PreVueloDeDatos
El mejor modelo de regresión que he visto en mi carrera tenía un R² de 0,96, y aun así fue el que más dinero le costó a su empresa.
Lo construyó una directora de calidad farmacéutica para una auditoría de la FDA. Usó 18 meses de datos y cientos de lotes. Estadísticamente, el modelo parecía perfecto. La auditoría se aprobó sin una sola observación.
Pero al revisar la documentación, noté algo extraño: en la carpeta de diagnósticos solo había una página con el valor de R².
Le hice la pregunta incómoda: “¿Dónde están los gráficos de residuos?” Me respondió: “El estadístico que contratamos dijo que con ese R² no hacían falta”.
Tres meses después, un lote de 2,3 millones de dólares fue rechazado.
Pausa rápida: R² es una medida entre 0 y 1 que indica qué porcentaje de la variación explican tus datos. Un R² de 0,96 significa que el modelo explica el 96 % de lo que pasa. Suena perfecto, y ese es el problema.
Usar una regresión sin revisar los residuos (que son simplemente la diferencia entre lo que el modelo predijo y lo que realmente ocurrió) es como un médico que te hace estudios avanzados pero nunca te toma la temperatura ni la presión. El R² es la prueba cara que impresiona; los residuos son los signos vitales. Y un paciente con signos vitales inestables sigue en peligro aunque sus estudios salgan perfectos.
No te voy a dar fórmulas ni manuales. Te voy a dar criterio: la capacidad de ver un modelo como un médico ve a un paciente, no solo la prueba costosa, sino los signos vitales que muestran si todo funciona bien.
Un modelo de regresión, dicho de forma simple, es una herramienta para entender qué variables influyen en tu resultado. En vez de adivinar, el modelo te dice: “si subes un grado la temperatura, tus defectos bajan X unidades”. Pero esto solo funciona si el modelo está bien construido.
Cuando yo empecé, trataba la regresión como una calculadora avanzada. Metía variables, veía coeficientes y celebraba el R². Hasta que un modelo mío, con R² de 0,89, recomendó cambiar la temperatura en una línea de ensamblaje. Resultado: 40 horas de paro no programado.
El modelo era “significativo”, pero los residuos tenían forma de arco, y yo ni los revisé.
Imagina que eres piloto comercial. Tienes 200 pasajeros. Tu avión es un Boeing 787, tecnología de punta. Pero antes de despegar, ¿qué haces? Tomas una checklist. Es la misma que se usa desde 1935, cuando un accidente mostró que incluso los mejores pilotos olvidan pasos críticos si confían solo en su memoria. No importa cuántas horas tengas ni lo avanzado del avión. Sin checklist, no despega nadie.
La regresión es igual. El avión es tu modelo. El prevuelo son seis verificaciones. Si te las saltas, estás despegando sin saber si tus instrumentos funcionan.
Verificación 1: ¿La relación tiene sentido?
Si las ventas de helado “predicen” los ahogamientos en la playa, no es un modelo útil, es una coincidencia. El calor es la causa real. Si la relación no tiene lógica, no despegas.
Verificación 2: ¿La relación es recta o curva?
Forzar una curva dentro de una recta es como usar un velocímetro que solo marca hasta 80 km/h cuando vas a 180. Si tus datos tienen curvatura, debes transformarlos.
Verificación 3: ¿Hay valores extremos que distorsionan todo?
Si la mayoría de tus tiempos son de 2 minutos pero algunos son de 4 horas, esos valores gigantes arrastran el modelo. Una transformación logarítmica puede ayudar, porque comprime los valores grandes para que no dominen.
Verificación 4: ¿Hay datos anómalos o errores?
Un solo dato incorrecto puede inclinar toda tu recta, como una ráfaga de viento cruzado. Revísalos. Si son errores, elimínalos. No los ignores solo porque son incómodos.
Verificación 5: ¿Dos variables se mueven juntas?
Si la temperatura del horno y la humedad del almacén cambian al mismo tiempo, el modelo no sabe cuál causa el efecto. A esto se le llama multicolinealidad; yo le digo confusión.
Verificación 6: ¿La distribución es razonablemente simétrica?
Si no lo es, los residuos te lo van a cobrar. Es como la gravedad: puedes ignorarla un rato, pero siempre aparece.
Volvamos a la directora farmacéutica. Sus datos eran buenos. Pero al revisar la multicolinealidad, vimos que la temperatura y la velocidad de agitación tenían una correlación de 0,91. Se movían juntas casi siempre. El modelo le daba todo el peso a la temperatura, pero la velocidad (el verdadero problema) quedaba oculta.
Luego revisamos los residuos y encontramos un patrón cíclico. El modelo funcionaba bien justo después del mantenimiento del reactor y fallaba antes del mantenimiento. El R² de 0,96 escondía ese patrón.
El lote de 2,3 millones falló justo antes del mantenimiento. El modelo no lo vio porque nadie hizo el prevuelo.
La regla prevuelo
Regla 1: El 90 % del trabajo es antes de correr el modelo. Explora tus datos como un piloto revisa su avión. Las seis verificaciones no son opcionales; son lo que separa un aterrizaje de un accidente.
Regla 2: Los residuos no mienten. Si tienen forma de embudo (la dispersión crece en los valores altos), de arco o siguen un patrón cíclico, tu modelo está mal, sin importar cuán alto sea tu R².
Regla 3: Un R² alto no es garantía de salud. Puedes tener un paciente con análisis perfectos y una hemorragia interna que esos análisis no ven. La significancia estadística (ese sello de “esto no es casualidad”) no es lo mismo que importancia práctica. Y cuando uses variables categóricas, como turno de trabajo o tipo de proveedor, recuerda: todas las opciones de una misma categoría se quedan juntas o se van juntas; nunca elimines solo una.
W. Edwards Deming dijo: “Sin datos, eres solo otra persona con una opinión”. Yo añadiría: con datos mal explorados, eres solo otra persona con una opinión que viene con gráficos bonitos. Piensa en tu último proyecto donde usaste regresión. ¿Cuántas de las seis verificaciones hiciste antes de presentar resultados? Si hiciste menos de cuatro, tu modelo despegó sin prevuelo.
Eso es todo por esta semana, Gracias a todos por sus calificaciones a mis libros La Mentalidad de Calidad, Principios de Calidad y Vida Calidad Proyectos. Si este episodio te dio una checklist que no tenías, dale like, suscríbete y compártelo con ese colega que todavía vuela sin instrumentos.
Mantente excelente, sigue mejorando. Y haz tu prevuelo.
Referencias:
- Belsley, D.A., Kuh, E. & Welsch, R.E. (1980) Regression Diagnostics: Identifying Influential Data and Sources of Collinearity. New York: Wiley.
- Kutner, M.H., Nachtsheim, C.J. & Neter, J. (2004) Applied Linear Statistical Models. 5th ed. New York: McGraw-Hill.
- Montgomery, D.C., Peck, E.A. & Vining, G.G. (2012) Introduction to Linear Regression Analysis. 5th ed. Hoboken: Wiley.
- Montgomery, D.C. (2019) Introduction to Statistical Quality Control. 8th ed. Hoboken: Wiley.
- Fox, J. (2016) Applied Regression Analysis and Generalized Linear Models. 3rd ed. Thousand Oaks: SAGE.
- Osborne, J.W. & Waters, E. (2002) ‘Four assumptions of multiple regression that researchers often ignore’, Practical Assessment, Research & Evaluation, 8(2), pp. 1–5.
- O’Hara, R.B. & Kotze, D.J. (2010) ‘Do not log-transform count data’, Methods in Ecology and Evolution, 1(2), pp. 118–122.
- Dormann, C.F. et al. (2013) ‘Collinearity: a review of methods to deal with it and a simulation study evaluating their performance’, Ecography, 36(1), pp. 27–46.
- Anscombe, F.J. (1973) ‘Graphs in statistical analysis’, The American Statistician, 27(1), pp. 17–21.
- Cook, R.D. (1977) ‘Detection of influential observation in linear regression’, Technometrics, 19(1), pp. 15–18.
- Tukey, J.W. (1977) Exploratory Data Analysis. Reading, MA: Addison-Wesley.
- Gelman, A. & Hill, J. (2007) Data Analysis Using Regression and Multilevel/Hierarchical Models. Cambridge: Cambridge University Press.