Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Métodos Cuantitativos para la Investigación en ...

Métodos Cuantitativos para la Investigación en Economía e Ingeniería

Avatar for Abraham Zamudio

Abraham Zamudio

September 24, 2026

More Decks by Abraham Zamudio

Other Decks in Education

Transcript

  1. Silabo del curso Métodos Cuantitativos para la Investigación en Economía

    e Ingeniería 2026 ​ Profesor Abraham Zamudio
  2. 1.​ Datos generales del curso Asignatura​ : Métodos Cuantitativos para

    la Investigación en Economía e Ingeniería Horas​ : 63 2.​ Presentación Existe una verdad incómoda en la formación de posgrado: la mayoría de los tesistas aprenden estadística demasiado tarde, demasiado rápido y demasiado desconectada de su propia investigación. El resultado es predecible: análisis mal planteados, decisiones metodológicas difíciles de justificar y resultados que se desmoronan ante las preguntas del comité. Este curso nace para cambiar esa realidad. No se trata de una colección de técnicas aisladas, sino de un recorrido cuidadosamente construido donde cada herramienta que aprendes responde a un problema real de tu tesis, se aplica con datos reales y se documenta con estándares de reproducibilidad que tu propio jurado podrá verificar. Todo análisis riguroso comienza antes del primer modelo. Por eso el curso dedica un espacio central a la gestión de datos y al análisis exploratorio riguroso, porque ninguna técnica sofisticada salva a un investigador que no comprende sus propios datos. Aprenderás a diagnosticar y clasificar valores faltantes según su mecanismo, a elegir estrategias de imputación justificadas teóricamente y a detectar valores atípicos con criterios estadísticos defendibles. Pero la verdadera virtud de este primer tramo está en su énfasis en la trazabilidad: cada decisión de limpieza quedará registrada, cada versión de tu análisis estará documentada en Git, y cada transformación podrá reproducirse paso a paso. Cuando tu comité te pregunte por qué eliminaste esas 45 observaciones, no improvisarás una respuesta: mostrarás el registro. A esto se suman la estadística descriptiva avanzada —momentos superiores, asimetría, curtosis— y la visualización científica efectiva, con layouts complejos, subtramas múltiples y gráficos interactivos que comunican hallazgos con precisión. Comenzarás tu tesis con datos confiables, decisiones documentadas y un entorno reproducible que te acompañará hasta la defensa. Sobre esa base se construye la inferencia, entendida no como un ritual de fórmulas sino como una herramienta de decisión. A través del Teorema del Límite Central, las distribuciones muestrales y la simulación, desarrollarás una intuición profunda sobre cómo se comporta la incertidumbre. Aprenderás a construir e interpretar intervalos de confianza en clave frecuentista y bayesiana, y a usar bootstrap cuando los supuestos fallen. La lección más valiosa de este tramo es que te enseña a reportar resultados con honestidad: en lugar de limitarte al p-valor, aprenderás a calcular tamaños del efecto, a evaluar la potencia estadística de tu estudio y a distinguir entre significancia estadística y relevancia práctica. Discutiremos abiertamente la controversia del p-valor a la luz de la declaración de la ASA, y explorarás alternativas como las pruebas de equivalencia y el factor de Bayes. Cuando defiendas tu tesis, no dirás simplemente que hay un efecto: dirás cuánto vale ese efecto, con qué margen de incertidumbre y con qué relevancia concreta en tu campo. Esa diferencia —entre reportar y comprender— es la que separa a un tesista competente de un investigador riguroso. La formación continúa con los modelos de regresión y sus diagnósticos, un terreno subestimado por muchos tesistas y, sin embargo, decisivo para la credibilidad de una tesis. Aquí no basta con ajustar un modelo y reportar coeficientes. Aprenderás la formulación matricial del método de Mínimos Cuadrados Ordinarios, comprenderás por qué los estimadores funcionan bajo los supuestos de Gauss-Markov, y desarrollarás la disciplina de diagnosticar sistemáticamente cada supuesto: interpretar gráficos de residuos, Q-Q plots y Scale-Location; aplicar pruebas formales como Jarque-Bera, Abraham Zamudio
  3. Omnibus K2, Breusch-Pagan, White, Durbin-Watson y Breusch-Godfrey; y detectar multicolinealidad

    mediante el VIF. Pero la verdadera riqueza de este tramo reside en las correcciones: cuando los supuestos fallan, no te quedarás de brazos cruzados. Aprenderás a aplicar errores estándar robustos, a comparar modelos con criterios de información y a reportar resultados en formato APA con transparencia total. Un modelo no termina cuando obtienes coeficientes significativos: termina cuando has verificado que los supuestos se cumplen, has corregido lo que no, y has comunicado con claridad tanto los hallazgos como sus limitaciones. El curso amplía después el horizonte hacia dos territorios que distinguen a las tesis ambiciosas: el análisis de series temporales y la inferencia causal. En el primero, aprenderás a modelar datos dependientes del tiempo —cruciales en economía, finanzas e ingeniería— identificando componentes de tendencia, estacionalidad, ciclicidad y ruido, aplicando pruebas de raíz unitaria e implementando modelos ARIMA, SARIMA y ARCH/GARCH para pronóstico y modelado de volatilidad. Este tramo te prepara para investigaciones donde el orden temporal importa y donde la dependencia entre observaciones exige un marco distinto al clásico. En el segundo, darás el salto de la correlación a la causalidad: construirás DAGs, aplicarás variables instrumentales, diferencias en diferencias, regresión discontinua y propensity score matching, y aprenderás a evaluar la heterogeneidad del efecto del tratamiento y a realizar análisis de sensibilidad a confusores no observados. La transformación es profunda: dejarás de describir asociaciones y comenzarás a explicar mecanismos causales, con el rigor que exige la investigación científica contemporánea. A este recorrido se incorporan las técnicas predictivas modernas, siempre con un enfoque que pocos cursos ofrecen: sin sacrificar la interpretabilidad. Aprenderás a diferenciar el modelado estadístico del machine learning, a comprender el dilema sesgo-varianza, a implementar validación cruzada rigurosa, y a aplicar regularización Ridge, Lasso y Elastic Net para manejar multicolinealidad y seleccionar variables. Explorarás árboles de decisión, Random Forests y Gradient Boosting, y aprenderás a calcular e interpretar la importancia de variables con métodos robustos. Pero la lección más significativa de este tramo es que te enseña a usar el machine learning como complemento de la inferencia, no como sustituto. Un modelo predictivo puede revelar relaciones no lineales e interacciones que un modelo lineal no captura, pero en una tesis debe dialogar con la teoría, no reemplazarla. El cierre del curso es el que convierte un análisis técnico en un hallazgo científico comunicable. Aprenderás a distinguir entre interpretabilidad global y local, a construir Partial Dependence Plots e ICE para visualizar relaciones no lineales y heterogeneidad, y a calcular valores SHAP para atribuir contribuciones tanto a nivel global como individual. La lección más profunda de este tramo es que te enseña a integrar machine learning e inferencia en una narrativa coherente: a evaluar la convergencia entre métodos, a interpretar divergencias, y a reportar resultados siguiendo estándares académicos con transparencia total. Aprenderás a documentar limitaciones con honestidad epistemológica, a distinguir entre lo que el modelo describe y lo que la realidad causal implica, y a producir un capítulo de resultados reproducible y defendible. Al terminar, no solo sabrás analizar datos: sabrás contar la historia que esos datos cuentan, con el lenguaje que la ciencia exige. Cada uno de estos tramos aporta una pieza distinta al rompecabezas de una tesis rigurosa. Juntos construyen un perfil de investigador que no teme a los datos, no improvisa decisiones, no oculta limitaciones y no confunde correlación con causalidad. Este curso no promete convertirte en estadístico profesional en pocas semanas, pero sí promete algo más valioso: darte las competencias, las herramientas y, sobre todo, la mentalidad de un investigador que trata sus datos con respeto, sus métodos con rigor y Abraham Zamudio
  4. sus conclusiones con honestidad. Porque al final, una tesis no

    se defiende con fórmulas memorizadas. Se defiende con decisiones fundamentadas, análisis reproducibles y comunicación clara. Y esa es, precisamente, la promesa que este curso cumple. 3.​ Objetivo general del curso Formar tesistas en el uso riguroso, reproducible e interpretativo de métodos estadísticos modernos —desde la gestión y exploración de datos hasta la inferencia causal y el machine learning explicativo—, capacitándolos para diseñar, ejecutar, diagnosticar y comunicar análisis cuantitativos que satisfagan los estándares de una tesis de posgrado y contribuyan a la producción de conocimiento científico verificable. 4.​ Objetivos específicos del curso •​ Diseñar e implementar un flujo de trabajo reproducible para la limpieza, imputación y documentación de datos, con trazabilidad total mediante Git. •​ Aplicar estadística descriptiva avanzada y visualización científica efectiva para comprender y comunicar la estructura de los datos. •​ Comprender la mecánica probabilística de la inferencia y aplicar pruebas paramétricas y no paramétricas, reportando tamaños del efecto e intervalos de confianza. •​ Construir, diagnosticar y corregir modelos de regresión, verificando sistemáticamente los supuestos y aplicando correcciones robustas. •​ Modelar datos dependientes del tiempo mediante ARIMA, SARIMA y ARCH/GARCH, evaluando pronósticos con métricas apropiadas. •​ Distinguir correlación de causalidad mediante experimentos controlados y métodos cuasi-experimentales (IV, DiD, RDD, PSM). •​ Incorporar técnicas de machine learning con validación cruzada rigurosa, comparándolas críticamente con modelos estadísticos tradicionales. •​ Interpretar modelos complejos mediante herramientas post-hoc (PDP, ICE, SHAP), distinguiendo interpretabilidad global y local. •​ Integrar hallazgos estadísticos y de machine learning en una narrativa coherente, reportando resultados en formato APA. •​ Implementar prácticas de investigación reproducible que garanticen la verificabilidad de los resultados ante un comité de tesis. 5.​ Resultados de aprendizaje Al finalizar el curso el alumno: •​ Preparar tus datos con rigor : limpiar, imputar y documentar cada decisión con trazabilidad total. •​ Explorar y visualizar tus datos con estadística descriptiva avanzada y gráficos científicos efectivos. •​ Inferir con honestidad : usar intervalos de confianza, tamaños del efecto y pruebas apropiadas, distinguiendo significancia estadística de relevancia práctica. •​ Construir y diagnosticar modelos de regresión, verificando supuestos y aplicando correcciones cuando sea necesario. •​ Modelar series temporales con ARIMA, SARIMA y GARCH, evaluando pronósticos con métricas apropiadas. •​ Distinguir correlación de causalidad aplicando DOE, variables instrumentales, diferencias en diferencias, regresión discontinua o propensity score matching. Abraham Zamudio
  5. •​ Aplicar machine learning con validación cruzada y regularización, comparándolo

    críticamente con modelos estadísticos. •​ Interpretar modelos complejos con PDP, ICE y SHAP, distinguiendo explicaciones globales y locales. •​ Integrar estadística y machine learning en una narrativa coherente y reportar resultados en formato APA. •​ Reproducir tu análisis de principio a fin con Git, entornos virtuales y notebooks ejecutables, dejando evidencia verificable para tu comité. 6.​ Metodología El curso se desarrolla bajo un enfoque de taller aplicado (no es un curso formativo sobre tópicos estadísticos), donde la teoría estadística se presenta siempre en función de su uso en la investigación real. Cada sesión sigue una estructura de tres fases: una breve exposición conceptual que introduce el fundamento estadístico; una demostración en vivo con código sobre datos reales y un ejercicio guiado donde el participante aplica la técnica Este diseño busca que el aprendizaje no se quede en el ejercicio abstracto, sino que se transforme en un producto concreto que el participante pueda incorporar a su investigación desde la primera semana. La metodología se apoya en tres principios transversales: rigor, reproducibilidad y honestidad científica. Todo análisis se documenta con control de versiones (Git), se ejecuta en entornos reproducibles y se reporta siguiendo estándares académicos. Se fomenta activamente el uso de datos reales, la comparación crítica entre métodos (frecuentista vs. bayesiano, paramétrico vs. no paramétrico, inferencial vs. predictivo) y la reflexión explícita sobre las limitaciones de cada técnica. 7.​ Contenido por Sesiones: # DE HORAS CONTENIDO 3hrs Limpieza de Datos con Trazabilidad 1.​ Identificar y clasificar valores faltantes según el mecanismo MCAR, MAR y MNAR. 2.​ Aplicar estrategias de imputación o eliminación justificadas según el mecanismo detectado. 3.​ Detectar y tratar outliers con criterios estadísticos defendibles. 4.​ Configurar un entorno virtual reproducible y un repositorio Git para su proyecto de tesis. Trazabilidad con Git 1.​ Por qué Git : motivación y conceptos 2.​ Configuración del repositorio 3.​ Flujo de trabajo diario: commits con sentido 4.​ Branching para investigación 5.​ El problema de los notebooks 6.​ Manejo de datos (grandes y sensibles) Abraham Zamudio
  6. 7.​ Recuperación ante desastres 8.​ Tags y releases 3hrs Estadística

    Descriptiva Avanzada y Visualización Científica 1.​ Calcular e interpretar momentos estadísticos superiores (asimetría, curtosis). 2.​ Evaluar la normalidad con múltiples criterios. 3.​ Diseñar visualizaciones científicas efectivas con múltiples subtramas. 4.​ Seleccionar el tipo de gráfico adecuado según la naturaleza de los datos. Visualización Avanzada y Flujo Reproducible Completo 3hrs 1.​ Diseñar layouts complejos con múltiples subtramas usando GridSpec. 2.​ Crear gráficos interactivos con Plotly para exploración de datos. 3.​ Implementar un flujo de trabajo completamente reproducible. 4.​ Exportar figuras con calidad de publicación. Fundamentos del Muestreo, TLC e Intervalos de Confianza 3hrs 1.​ Teorema del Límite Central y su rol en la inferencia. 2.​ Simular distribuciones muestrales y verificar propiedades asintóticas. 3.​ Calcular e interpretar intervalos de confianza en su contexto de investigación. 4.​ Diferenciar la interpretación frecuentista de la bayesiana de un intervalo. 5.​ Aplicar bootstrap para estimar IC cuando no se cumplen supuestos. Pruebas Paramétricas — t-Student y ANOVA 3hrs 1.​ Prueba de hipótesis (H0, H1, región crítica). 2.​ Seleccionar la prueba paramétrica adecuada según el diseño de investigación. 3.​ Ejecutar e interpretar t-Student (una muestra, independiente, pareada) y ANOVA. 4.​ Calcular y reportar tamaños del efecto (Cohen's d, η², ω²). 5.​ Análisis de potencia y tamaños muestrales. Pruebas No Paramétricas y la Controversia del p-valor 3hrs 3hrs 1.​ Seleccionar pruebas no paramétricas cuando no se cumplen supuestos. 2.​ Ejecutar Mann-Whitney U y Kruskal-Wallis con post-hoc. 3.​ El p-value y la significancia estadística. 4.​ Distinguir significancia estadística de relevancia práctica. 5.​ Aplicar pruebas de equivalencia (TOST) y alternativas bayesianas. Formulación, Ajuste y Diagnóstico de Normalidad Abraham Zamudio
  7. 1.​ Formulación matricial del modelo de regresión lineal y el

    método de Mínimos Cuadrados Ordinarios (MCO). 2.​ Ajustar modelos de regresión simple y múltiple utilizando statsmodels. 3.​ Diagnóstico gráfico de residuos (residuos vs. ajustados, Q-Q plot, Scale-Location). 4.​ Evaluar la normalidad de los residuos mediante las pruebas de Jarque-Bera y Omnibus 5.​ Interpretar los resultados de las pruebas de normalidad en el contexto de su tesis. Diagnóstico Avanzado — Heterocedasticidad, Autocorrelación y Multicolinealidad 3hrs 1.​ Heterocedasticidad mediante pruebas formales (Breusch-Pagan, White) e interpretar sus implicaciones. 2.​ Autocorrelación con Durbin-Watson y Breusch-Godfrey. 3.​ Evaluar multicolinealidad mediante el Factor de Inflación de la Varianza (VIF). 4.​ Comprender las consecuencias de cada violación de supuestos sobre la inferencia. 5.​ Seleccionar la estrategia de corrección adecuada para cada problema. Correcciones, Robustez e Interpretación para la Tesis 3hrs 1.​ Aplicar errores estándar robustos (Huber-White, Newey-West) y comparar con MCO estándar. 2.​ Selección de modelos mediante criterios de información (AIC, BIC) y validación cruzada. 3.​ Interpretar coeficientes en términos prácticos (marginal effects). 4.​ Reportar resultados de regresión siguiendo el formato APA. 5.​ Integrar todo el flujo de modelado en un caso completo. Componentes, Estacionariedad y Raíces Unitarias 3hrs 1.​ Algoritmos de Identificación de los componentes de una serie temporal (tendencia, estacionalidad, ciclicidad, ruido). 2.​ Descomposición STL y análisis exploratorio de series. 3.​ Comprender el concepto de estacionariedad y sus implicaciones. 4.​ Pruebas de raíz unitaria (ADF, KPSS) e interpretar resultados conjuntos. 5.​ Diferenciar una serie para lograr estacionariedad y evaluar el orden de integración. Modelos ARIMA y SARIMA 3hrs 1.​ El orden (p, d, q) de un modelo ARIMA mediante ACF/PACF y criterios de información. 2.​ ARIMA y SARIMA. 3.​ Validación de modelos : Análisis de residuos y pruebas de diagnóstico. 4.​ Generación de pronósticos con intervalos de confianza. 5.​ Selección automática de modelos. Abraham Zamudio
  8. Volatilidad (ARCH/GARCH) y Evaluación de Pronósticos 3hrs 1.​ El fenómeno

    de volatilidad agrupada (clustering) en series financieras. 2.​ Estimación de modelos ARCH y GARCH para modelar la varianza condicional. 3.​ Evaluación de pronósticos con métricas apropiadas (RMSE, MAE, MAPE). 4.​ Pruebas de Diebold-Mariano (Comparación de pronósticos). 5.​ Backtesting de modelos de volatilidad. DOE — Experimentos Controlados y la Lógica de la Causalidad 1.​ Tres principios de Fisher: aleatorización, replicación y bloqueo. 3hrs 𝑘 2.​ Experimentos factoriales 2 : Efectos principales e interacciones. 3.​ Diseños en bloques aleatorizados (RCBD) para controlar variables de ruido. 4.​ Metodología de superficie de respuesta (RSM) para optimización. 5.​ Conectar el DOE clásico con el marco de resultados potenciales. Inferencia Causal en Estudios Observacionales 3hrs 1.​ El problema fundamental de la inferencia causal y el rol de la confusión. 2.​ Construcción de DAGs para identificar qué variables controlar. 3.​ Variables Instrumentales (IV) para manejar endogeneidad. 4.​ Implementar Diferencias en Diferencias (DiD) para evaluar políticas. 5.​ Regresión Discontinua (RDD) cuando hay una regla de asignación. 6.​ Propensity Score Matching (PSM) en estudios observacionales. Interpretación y Casos Integradores 3hrs 1.​ Diferenciar entre coeficientes predictivos y causales en la interpretación. 2.​ Evaluación de la heterogeneidad del efecto del tratamiento (HTE). 3.​ Análisis de sensibilidad a confusores no observados. 4.​ Seleccionar el método causal apropiado según el diseño disponible. 5.​ Reportar resultados causales siguiendo estándares de la literatura. Fundamentos, Regularización y Validación Cruzada 3hrs 1.​ El modelado estadístico (inferencia) del machine learning (predicción) 2.​ El dilema sesgo-varianza : Consecuencias del sobreajuste y subajuste. 3.​ Validación cruzada (k-fold, LOOCV, temporal) : Estimación del error de generalización. 4.​ Regularización Ridge (L2) y Lasso (L1) : Multicolinealidad y selección de variables. 5.​ Seleccionar el hiperparámetro óptimo λ mediante validación cruzada. 3hrs Abraham Zamudio
  9. Árboles, Random Forests e Importancia de Variables 1.​ Árboles de

    decisión y sus hiperparámetros. 2.​ Random Forests y Gradient Boosting para predicción. 3.​ Cálculo e interpretación de la importancia de variables 4.​ Comparación de modelos basados en árboles con modelos lineales regularizados. 5.​ Identificar relaciones no lineales e interacciones mediante árboles. Fundamentos — Interpretabilidad Global vs. Local y PDP/ICE 3hrs 1.​ Interpretabilidad global de local 2.​ Importancia por permutación como baseline de interpretabilidad global. 3.​ Construir PDP (Partial Dependence Plots) para visualizar efectos promedio. 4.​ Construir ICE (Individual Conditional Expectation) para detectar heterogeneidad. 5.​ Reconocer las limitaciones de PDP e ICE (extrapolación, correlación entre features). SHAP — Teoría, Cálculo e Interpretación 3hrs 1.​ Fundamentos teóricos de los valores de Shapley. 2.​ Explainer SHAP apropiado según el tipo de modelo. 3.​ Calculo de valores SHAP para modelos basados en árboles, lineales y deep learning. 4.​ Interpretación : SHAP globalmente (summary, bar, dependence) y localmente (waterfall, force). 5.​ Interacciones mediante SHAP interaction values. Integración, Reporte Académico y Caso Completo 3hrs 1.​ ML interpretativo con inferencia estadística : Una narrativa coherente. 2.​ Evaluación de convergencia entre métodos (ML vs. regresión). 3.​ Reportes de ML siguiendo estándares académicos (APA, journals). 4.​ Documentar limitaciones y advertencias epistemológicas. 5.​ Producir un capítulo de resultados reproducible y defendible. ​ •​ Prerrequisitos:​ Curso Básico de Python Estadística Universitaria Conocimientos básicos sobre aprendizaje automático 8.​ Bibliografía ​ •​ Hyndman, R. J., Athanasopoulos, G. (2021). Forecasting: Principles and Practice. Reino Unido: OTexts. Abraham Zamudio
  10. •​ James, G., Witten, D., Hastie, T., Tibshirani, R. (2013).

    An Introduction to Statistical Learning: With Applications in R. Alemania: Springer New York. •​ Molnar, C. (2022). Interpretable Machine Learning: A Guide for Making Black Box Models Explainable. Alemania: Christoph Molnar. •​ Molak, A. (2024). Inferencia y descubrimiento causal en Python: Descubra los secretos del machine learning causal moderno con DoWhy, EconML, PyTorch y mucho más. España: ANAYA MULTIMEDIA. •​ Angrist, J. D., Pischke, J. (2009). Mostly harmless econometrics : an empiricist's companion. Reino Unido: Princeton University Press. •​ Madhyastha, N. R. M., Ravi, S., Praveena, A. S. (2020). A First Course in Linear Models and Design of Experiments. Alemania: Springer Nature Singapore. •​ Fox, J. (2019). Regression Diagnostics: An Introduction. Estados Unidos: SAGE Publications. •​ Chatterjee, S., Hadi, A. S. (2006). Regression Analysis by Example. Alemania: Wiley-Interscience. •​ Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108 •​ Cohen, J. (2013). Statistical Power Analysis for the Behavioral Sciences. Reino Unido: Taylor & Francis. •​ Wilke, C. (2019). Fundamentals of Data Visualization: A Primer on Making Informative and Compelling Figures. Taiwán: O'Reilly Media. •​ Kaufmann, M. (2022). Accelerate DevOps with GitHub: Enhance Software Delivery Performance with GitHub Issues, Projects, Actions, and Advanced Security. Alemania: Packt Publishing. Abraham Zamudio