Unidad 6 · Métodos modernos asistidos por IA

Gancho Mona Lisa + DAG → estrategia → método + Lab L4 · 3h online · 🏁 H3 asincrónico

Autor/a
Afiliación

Juan Carlos Muñoz-Mora, PhD

Universidad EAFIT · Escuela de Finanzas, Economía y Gobierno

El DAG eligió la estrategia; el método es la implementación. U6 abre el Sprint macro C (DESIGN & DEFENSE) con el gancho Mona Lisa: 5 imágenes que muestran qué hipótesis querés estimar y qué pasa cuando los datos chocan con tus decisiones — la tesis del día es “el método NO se elige, el método depende”. Tomamos el DAG de H2 y lo convertimos en un PAP moderado ((Banerjee et al., 2020)) con identificación justificada. La sesión vive del DAG hacia adelante: los 6 patrones DAG canónicos (randomización · selección sobre observables · IV · RDD · variación temporal · alta dimensión) mapean a estrategias de identificación, y los métodos (OLS · 2SLS · RDD · CS/CDH · Synthetic · DML) son respuestas operativas — no menú. Para el patrón estrella (variación temporal), la DiD revolution post-2018 ((Goodman-Bacon, 2021), (Roth et al., 2023), (Callaway & Sant’Anna, 2021), (de Chaisemartin & D’Haultfœuille, 2020)) marca por qué TWFE clásico está roto en staggered y qué lo reemplaza. 4 ejemplos trabajados (4G/Catatumbo · microcrédito · cesárea · reforma Bolivia) dan el músculo aplicado. El Lab L4 (pair programming aumentado) es la apuesta pedagógica: Copilot/Cursor/Claude escribe el boilerplate · vos auditás línea por línea — modo AIAS 4 explícito con audit log denso. Replication Court mini ((Brodeur et al., 2020)) cierra la sesión con 3 pares juzgando tu identificación. 🏁 H3 PAP moderado + Lab L4 (20%) → entrega asincrónica viernes 22/05 · 23:59.

Sesión: S06 · Martes 19/05 · 3h online · 18:00–21:00 · 4 sprints + 🏁 H3 asincrónico · Modo AIAS: 4 (Full Support · auditada) · Lab IA²: L4

Estructura · 4 Sprints + 🏁 H3 asincrónico

Tiempo Sprint Foco JC · Act
0–15 🎨 Gancho Mona Lisa + Sprint 0 5 imágenes · “el método depende” · standup post-H2 · setup técnico 10 · 5
15–75 Sprint 1 · 🎯 Del DAG al método 6 patrones DAG canónicos · 4 ejemplos trabajados · TWFE roto · CS/CDH/IV/RDD/Synthetic/DML como respuestas 45 · 15
75–85 ☕ Break
85–145 Sprint 2 · 🤝 Lab L4 · Pair Programming Event-study con Copilot/Claude · audit log denso · cross-check múltiple 15 · 45
145–150 ☕ Break corto
150–180 Sprint 3 · ⚔️ Replication Court mini 3 pares juzgan identificación · red teaming PAP · roadmap H3 asincrónico 10 · 20

🏁 H3 PAP moderado + Lab L4 (20%) → entrega asincrónica viernes 22/05 · 23:59 (Sprint 4 lockdown del diseño original ahora vive en casa)

Presentación de la unidad

Tip

🎥 Abrir presentación

Atajos: F fullscreen · ←/→ navegar · Esc overview · S speaker notes · B chalkboard · ? ayuda

Piezas pedagógicas icónicas

🗺️ Los 6 patrones DAG canónicos · el panorama

Antes de nombrar métodos, U6 enseña a leer la estructura del DAG para inferir la estrategia de identificación. Los 6 patrones cubren prácticamente toda la investigación causal aplicada: (1) randomización (RCT · no backdoor) · (2) selección sobre observables (D ← X → Y, X medible) · (3) instrumento (Z exógeno que afecta D pero no Y directamente) · (4) discontinuidad (D = 1[X ≥ c]) · (5) variación temporal (panel con tratamiento escalonado · el patrón estrella) · (6) alta dimensión observables (muchos X · ML para nuisance). Cada patrón se reconoce mirando el DAG H2; cada uno tiene 1-3 métodos como implementación.

🎯 El patrón estrella · variación temporal y la DiD revolution

Goodman-Bacon 2021 demostró un teorema demoledor: cuando hay tratamiento escalonado + efectos heterogéneos, el coeficiente TWFE estándar es un promedio ponderado de comparaciones 2×2 con pesos negativos. TWFE puede dar el signo equivocado de un efecto real. Por eso este patrón merece atención especial: es el más común en tesis MAE y el más subtle. La revisión canónica de (Roth et al., 2023) (sec. 6) es la guía de cuándo usar Callaway-Sant’Anna, de Chaisemartin-D’Haultfœuille, Sun-Abraham o Borusyak-Jaravel-Spiess como reemplazos modernos.

📋 4 ejemplos trabajados · DAG → estrategia → método

El Sprint 1 dedica 15 minutos a clasificar 4 casos en parejas — el músculo aplicado de la unidad. (A) 4G en Catatumbo — pueblos cruzados por conflicto reciben 4G en distintos años → patrón 5 staggered → CS o CDH. (B) Microcrédito BancaMía — 2000 hogares aleatorizados → patrón 1 → ITT/ATE. (C) Cesárea automática — umbral peso < 2500g → patrón 4 → RDD sharp. (D) Reforma agraria Bolivia 2009 — 1 país tratado, panel LATAM control → patrón 5c → Synthetic Control. Cada caso recorre el flujo DAG → estrategia → método sin pasar primero por el nombre de la técnica.

🤝 Lab L4 · El pair programming aumentado (modo AIAS 4)

El estudiante dirige y audita; Copilot/Cursor/Claude implementa. La inversión de roles del Lab L3 (donde la IA criticaba al humano) — ahora la IA escribe y el humano critica. Audit log denso con: prompt usado · output recibido · decisión (aceptar/rechazar/editar) · justificación. Cross-check obligatorio con ≥2 estimadores (ej: did + DIDmultiplegt). Trampa documentada de (Dell’Acqua et al., 2023): los humanos sobre-aceptan output de IA fuera de su jagged frontier. Por eso ≥1 error introducido por IA debe ser detectado y documentado en el audit — si no lo encontraste, no auditaste bien.

📜 PAP moderado · “in praise of moderation” (Banerjee-Duflo 2020)

El mini-PAP de H1 declaraba intención. El PAP de H3 disciplina decisiones. Banerjee-Duflo argumentan contra el extremo “lock everything before seeing data” (poco realista en cuasi-experimentos) y el extremo “PAP de palabra” (irrelevante): el PAP moderado pre-registra la especificación primaria y los ajustes principales · admite exploratoria post-hoc pero la marca como tal. Estructura canónica: pregunta · DAG · identificación · especificación primaria · análisis de robustez · placebos · sensitivity · poder estadístico. Esa es la entrega H3 asincrónica del viernes 22/05.

⚔️ Replication Court · el jurado entre pares (Brodeur 2020)

(Brodeur et al., 2020) mostró un hallazgo crudo: el método predice el p-hacking. IV y DiD tienen mucho más exceso de p-valores justo abajo de 0.05 que RCT o RDD. Por eso la sesión incluye Replication Court mini: 3 pares juzgan tu identificación con protocolo formal — revisan código, recorren la especificación, atacan los supuestos. Veredicto firmado entra al audit log. La idea es someter la identificación al escrutinio adversarial antes de que llegue al jurado real (U8 · sustentación).

🏁 H3 asincrónico · cierre del primer día del Sprint macro C

La entrega integra: PAP moderado v1 + script reproducible + audit log L4 + ≥2 estimadores como robustez + veredicto Replication Court + reporte AIAS. Se trabaja en aula y se cierra asincrónico hasta viernes 22/05 · 23:59. El jueves abrimos U7 (Comunicación + póster Quarto · Lab L5).

Conversar con el corpus de la unidad

💬 NotebookLM · Unidad 6

NotebookLM tiene cargadas todas las lecturas, slides y notas de esta unidad. Pregúntale cualquier concepto, cita o conexión y te responde con referencia al material.

Abrir NotebookLM →

Requiere cuenta de Google. La conversación con el bot es parte del experimento: usar IA² para aprender IA².

Recursos relacionados

Bibliografía clave de la unidad

Núcleo · Sprint 1 · DAG → estrategia → método (★★★):

  • Cunningham (2021) — Mixtape · marco unificado DAG/IV/RDD/DiD · panorama de los 6 patrones (JC 2/5)
  • Roth et al. (2023) — What’s trending in DiD? (J. Econometrics) · guía operativa staggered (JC 3/5)
  • Goodman-Bacon (2021) — DiD with variation in treatment timing · TWFE decomposition · pesos negativos (JC 3/5)
  • Callaway & Sant’Anna (2021) — DiD with multiple time periods · ATT(g,t) · estándar nuevo (JC 4/5)
  • de Chaisemartin & D’Haultfœuille (2020) — TWFE estimators with heterogeneous effects (AER) · DIDM (JC 4/5)
  • Cinelli et al. (2024) — Good/bad controls · puente desde U5 (JC 1/5 fuente de variación)

Núcleo · PAP + replication transparency:

  • Banerjee et al. (2020) — In praise of moderation · PAP moderado · template canónico
  • Brodeur et al. (2020) — Methods matter — p-hacking diferencial por método (★★★ Replication Court)
  • Christensen & Miguel (2018) — Transparency, reproducibility & credibility of research (JEL)

Núcleo · IA en métodos (frontera 2025):

  • Ludwig et al. (2025) — LLMs como variables en modelos econométricos · 3 diagnósticos
  • Korinek (2023) + Korinek (2024) — LLM como graduate student junior → senior
  • Dell’Acqua et al. (2023) — Jagged frontier · capability-task fit

Sustento · textbooks modernos y métodos:

  • Abadie (2021) — Using synthetic controls (JEL)
  • Athey & Imbens (2019) — ML methods that economists should know (Annual Review)
  • Cunningham (2021) — Causal Inference: The Mixtape · libre online
  • Huntington-Klein (2022) — The Effect · libre online
  • Cinelli et al. (2024) — Good and bad controls (puente con U5)
  • Hernán & Robins (2020) — Causal Inference: What If
📚 Bibliografía completa

La unidad referencia la bibliografía maestra del curso. Descarga el archivo BibTeX:

📥 Descargar references.bib

Volver arriba

Referencias

Abadie, A. (2021). Using Synthetic Controls: Feasibility, Data Requirements, and Methodological Aspects. Journal of Economic Literature, 59(2), 391-425. https://doi.org/10.1257/jel.20191450
Athey, S., & Imbens, G. W. (2019). Machine Learning Methods That Economists Should Know About. Annual Review of Economics, 11, 685-725. https://doi.org/10.1146/annurev-economics-080217-053433
Banerjee, A., Duflo, E., Finkelstein, A., Katz, L. F., Olken, B. A., & Sautmann, A. (2020). In Praise of Moderation: Suggestions for the Scope and Use of Pre-Analysis Plans for RCTs in Economics (NBER Working Paper 26993). National Bureau of Economic Research. https://doi.org/10.3386/w26993
Brodeur, A., Cook, N., & Heyes, A. (2020). Methods Matter: \(p\)-Hacking and Publication Bias in Causal Analysis in Economics. American Economic Review, 110(11), 3634-3660. https://doi.org/10.1257/aer.20190687
Callaway, B., & Sant’Anna, P. H. C. (2021). Difference-in-Differences with Multiple Time Periods. Journal of Econometrics, 225(2), 200-230. https://doi.org/10.1016/j.jeconom.2020.12.001
Christensen, G., & Miguel, E. (2018). Transparency, Reproducibility, and the Credibility of Economics Research. Journal of Economic Literature, 56(3), 920-980. https://doi.org/10.1257/jel.20171350
Cinelli, C., Forney, A., & Pearl, J. (2024). A Crash Course in Good and Bad Controls. Sociological Methods and Research, 53(3), 1071-1104. https://doi.org/10.1177/00491241221099552
Cunningham, S. (2021). Causal Inference: The Mixtape. Yale University Press.
de Chaisemartin, C., & D’Haultfœuille, X. (2020). Two-Way Fixed Effects Estimators with Heterogeneous Treatment Effects. American Economic Review, 110(9), 2964-2996. https://doi.org/10.1257/aer.20181169
Dell’Acqua, F., McFowland III, E., Mollick, E. R., Lifshitz-Assaf, H., Kellogg, K., Rajendran, S., Krayer, L., Candelon, F., & Lakhani, K. R. (2023). Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality (Working Paper 24-013). Harvard Business School.
Goodman-Bacon, A. (2021). Difference-in-Differences with Variation in Treatment Timing. Journal of Econometrics, 225(2), 254-277. https://doi.org/10.1016/j.jeconom.2021.03.014
Hernán, M. A., & Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC.
Huntington-Klein, N. (2022). The Effect: An Introduction to Research Design and Causality. Chapman & Hall/CRC. https://doi.org/10.1201/9781003226055
Korinek, A. (2023). Generative AI for Economic Research: Use Cases and Implications for Economists. Journal of Economic Literature, 61(4), 1281-1317. https://doi.org/10.1257/jel.20231736
Korinek, A. (2024). LLMs Level Up—Better, Faster, Cheaper: June 2024 Update to «Generative AI for Economic Research» [Working Paper Update]. University of Virginia; Brookings. https://genaiforecon.org/JEL-2024-June-LLMsLevelUp.pdf
Ludwig, J., Mullainathan, S., & Rambachan, A. (2025). Large Language Models: An Applied Econometric Framework (NBER Working Paper 33344). National Bureau of Economic Research. https://doi.org/10.3386/w33344
Roth, J., Sant’Anna, P. H. C., Bilinski, A., & Poe, J. (2023). What’s Trending in Difference-in-Differences? A Synthesis of the Recent Econometrics Literature. Journal of Econometrics, 235(2), 2218-2244. https://doi.org/10.1016/j.jeconom.2023.03.008