Métodos modernos asistidos por IA

Del DAG al método · DiD revolution · Lab L4 pair programming · Gancho Mona Lisa + 4 Sprints + 🏁 H3 asincrónico

Juan Carlos Muñoz-Mora, PhD

Universidad EAFIT · Escuela de Finanzas, Economía y Gobierno

19 de mayo de 2026

Bienvenidos

Unidad 6 — Métodos modernos asistidos por IA

Sesión 6 · Martes 19/05 · 3h online · 18:00–21:00

Nota

Pregunta guía: ¿Qué método responde mi pregunta de identificación dado mi DAG H2 · y cómo escribo código auditable con IA como copiloto?

Lo que se lleva esta sesión:

  • ✅ DAG -> Cuestión
  • ✅ Lab L4 (pair programming) iniciado en clase
  • ✅ Veredicto Replication Court entre pares
  • 🏁 H3 PAP moderado + Lab L4 · entrega asincrónica viernes 22/05 · 23:59

🎨 El gancho · ¿Qué hipótesis querés estimar?

De la hipótesis que el DAG H2 dibujó · al método que te permite estimarla bien

¿Qué hipótesis querés estimar?

Esto es lo que tu DAG H2 dice que querés estimar.

Tu hipótesis primaria — sea causal (4 elementos · dirección · magnitud · mecanismo · condicionalidad) o de otro tipo (descriptiva · comparativa · mecanística · exploratoria) — define el rostro que perseguís.

  • Salieron de la sesión anteior con esta hipótesis mapeada a aristas del DAG.
  • No es la versión idealizada · es la que la realidad permite identificar.
  • Hoy vemos qué pasa cuando llegan los datos y empieza el choque.

→ Antes de elegir método: ¿saben qué hipótesis están persiguiendo?

Pero con los datos · granularidad gruesa

Pero los datos llegan así.

Panel trimestral en lugar de mensual · censo cada 4 años en lugar de continuo · municipio en lugar de barrio.

  • Granularidad temporal/espacial gruesa = solo ves manchas de color.
  • No podés separar efecto instantáneo de dinámica.
  • Pre-trends invisibles a baja frecuencia.

→ La data limita lo que el método puede ver. El rostro existe — pero acá no se distingue.

Pero con los datos · especificación errada

Pero los datos tienen tratamiento escalonado.

Y vos aplicaste TWFE clásico — peinado de 2026 sobre cuadro de 1503.

  • Técnicamente “corre”.
  • (Goodman-Bacon, 2021): pesos negativos · puede dar el signo equivocado.
  • El resultado se ve plausible — pero no es la cara que perseguías.

→ La especificación tiene que empatar con la estructura del tratamiento. Misma data, distinta cara.

Pero con los datos · sobre-controlado

Pero los datos tienen muchas variables.

Y vos “le metiste todos los controles que tenías, por las dudas”.

  • Controles post-tratamiento → cierran el canal causal.
  • Colliders → abren backdoor que estaba cerrado.
  • Bad controls (Cinelli et al., 2024) deforman · no limpian.

→ El DAG decide qué entra al modelo. No la intuición del investigador.

Y lo que con disciplina sí podés estimar

Esto es lo que SÍ podés estimar.

Cuando datos · DAG · método empatan, llegás a un coeficiente identificable · defendible · replicable.

  • Mismo DAG · mismos datos · método disciplinado.
  • ATT identificado · pre-trends diagnosticados · cross-validation con ≥2 estimadores.
  • No es perfecto (nada lo es) — pero es honesto sobre qué es y qué no es.

→ Esta es la pregunta que defientdes con la que te defendés.

La tesis de U6 · el método depende

El método NO se elige.

El método depende.

Depende de… Decisión que fija
Tus datos Granularidad temporal · balance · missings · variación
Tu DAG (H2) Qué backdoor cerrar · qué controlar · qué ignorar
Tu pregunta ATT promedio · heterogeneidad · mecanismo · contrafactual
La estructura del tratamiento TWFE clásico · staggered · synthetic · IV · RDD

Hoy aprendemos cómo se decide. No con voto · con criterio. Sprint 1 lo abre.

Cómo trabajamos hoy — 3h online · 4 Sprints

Regla del aula: Modo AIAS dominante hoy = 4 (Full Support · auditada). La IA escribe; vos auditás línea por línea. Audit log denso. Sin audit no hay entrega.

Consejo

Lecturas hoy: (Roth et al., 2023) (★★★ · sec. 6) · (Goodman-Bacon, 2021) (teorema) · (Callaway & Sant’Anna, 2021) · (de Chaisemartin & D’Haultfœuille, 2020) · (Banerjee et al., 2020) (PAP moderado) · (Brodeur et al., 2020) (★★★ Replication Court) · (Ludwig et al., 2025) (LLMs como datos).

El bridge · H1 + H2 + DAG → 🏁 H3 PAP moderado

Anteanoche entregaron H1 (PRON · OG · OE). Anoche cerraron Sprint B con H2 (Evidence Map + DAG + hipótesis). Hoy abrimos Sprint C — DESIGN & DEFENSE: el DAG ya eligió el método; ahora hay que escribir el código que ese DAG implica y defender la identificación contra el escrutinio de pares.

🏁 H1 (U3)
PRON 2 págs
OG + 3 OE · 15%
→
🏁 H2 (U5)
Evidence Map
+ DAG · 20%
→
🎯 Sprint 1
DiD revolution
elegir estimador
→
🤝 Sprint 2
Lab L4 Pair
Programming
→
⚔️ Sprint 3
Replication
Court
→
🏁 H3
PAP moderado
+ Lab L4 · 20%

Sprint 0 · 🎤 Standup

10 JC · 10 Act · Check del DAG H2 + ¿qué método sospechás? + montar proyecto IA² (4 espacios)

📍 Estructura del Sprint 0 (20 min)

1Check H2¿entregaron DAG anoche? · ¿hay confusiones pendientes?
2Puente DAG → métodoCada arista del DAG = hipótesis verificable + identificación
3Mapeo pregunta → métodoTabla rápida: tipo de pregunta · datos · sospecha de método
4Modo AIAS 4 explícitoQué cambia del Lab L3 (crítica) al Lab L4 (pair coding)
🛠Montar el proyecto · 10 min4 espacios: estructura · memoria IA · audits · reproducibilidad

🎓 Check del DAG H2 + cuál es el método indicado (5 min)

Consejo

El método no se elige por moda — se elige por:

  1. Pregunta (asociativa · interventiva · contrafactual — Pearl ladder)
  2. DAG (qué backdoors hay · qué se puede bloquear)
  3. Datos (panel · cross-section · longitudinal · texto)
  4. Honestidad (qué supuestos podés defender)

Advertencia

Trampa pedagógica: “voy a usar DiD porque es lo que aprendí”. ❌ Eso es la herramienta determinando la pregunta. El DAG decide; vos sólo defendés esa decisión.

🧩 Del DAG a la hipótesis verificable al método (puente U5 → U6)

** El DAG quedó dibujado. Hoy lo traducimos en 3 pasos a un método de identificación auditable.** Cada arista del DAG no es decoración — es una hipótesis verificable que el método debe poder testear.

① Arista del DAG (U5)
  • X → Y con dirección + signo esperado
  • Confounders Z identificados
  • Backdoor paths marcados
  • Cita Evidence Map por arista
Pearl: la estructura causal vive aquí.
② Hipótesis verificable (4 elementos)
  • 🎯 Dirección (X aumenta · disminuye Y)
  • 📏 Magnitud (banda esperada · efecto mínimo detectable)
  • ⚙️ Mecanismo (vía qué mediador opera)
  • 🎚️ Condicionalidad (cuándo deja de aplicar)
Take it seriously · ≥1 placebo inverso.
③ Método de identificación (U6)
  • Estimador primario justificado por DAG
  • Cross-check con estimador alternativo
  • Placebos y sensitivity que testean la arista
  • Especificación pre-registrada en PAP
Si no testea la arista, no es el método.

Consejo

Linaje epistemológico (resumen brutal · 180 años):

Año Aporte Hoy se ve como
1843 Mill · A System of Logic Canon positivo + negativo + método de la diferencia Lógica del contrafactual · counterfactual reasoning
2000 Pearl · Causality DAGs + do-calculus + backdoor criterion Formalización del canon de Mill
2021 Goodman-Bacon TWFE decomposition · pesos negativos Stress test del método cuando el DAG es panel staggered

→ El DAG no es invento de moda · es Mill 1843 con sintaxis 2000 y diagnóstico 2021.

Advertencia

Causalidad ≠ correlación (recordatorio operativo):

“Las implicaciones causales provienen del razonamiento conceptual (teoría) en lugar de la evidencia empírica.”

→ El DAG es ese razonamiento conceptual hecho explícito. El método sólo testea lo que el DAG ya dijo que es testeable. Si tu método “descubre” causalidad que el DAG no implicaba → estás haciendo p-hacking, no inferencia.

🤖 ¿Qué cambia hoy? · Lab L4 ≠ Lab L3 (3 min)

Inversión de roles desde el Lab L3 (anoche · DAG):

👤 HUMANO · Lab L4
  • Dirige — define qué hay que implementar
  • Audita — cada línea de código que la IA escribe
  • Verifica — corre tests · cross-check con ≥2 estimadores
  • Decide — aceptar · rechazar · editar la sugerencia
  • Documenta — audit log denso con prompt + decisión
🤖 IA · Lab L4
  • Implementa — boilerplate · sintaxis · paquetes
  • Propone — alternativas de especificación · diagnósticos
  • Explica — qué hace cada línea cuando preguntás
  • Refactoriza — limpia código cuando lo pedís
  • NUNCA decide identificación · controles · supuestos

Modo AIAS dominante hoy:

0No-AI
1Asistencia
2Consulta
3Colaboración
4Full Support
⭐ HOY

(Perkins et al., 2024): modo 4 = operativa auditada. La IA produce salida útil; el humano se queda con la responsabilidad de la decisión. Si la IA escribió tu regresión y vos no podés explicar cada línea → ese código no es tuyo.

🛠 Montar el proyecto para trabajo empírico con IA (10 min · Act)

⏱️ S0 · Setup proyecto IA² 10:00

Antes de escribir una línea de código con IA, el proyecto necesita 4 espacios bien definidos. La carpeta no es organización personal — es la interfaz que tu IA va a leer cada vez que la invoques.

① Estructura · carpetas estables
tesis/
├── data/      ⛔ gitignored
│   ├── raw/
│   └── processed/
├── code/      📜 numerado
│   ├── 01_clean.R
│   ├── 02_did.R
│   └── 99_robust.R
├── output/    📊 regenerable
├── audit/     📝 L1–L5
├── prompts/   💬 reproducible
├── docs/      📖 PAP · DAG · README
└── Makefile
② Memoria · qué lee tu IA
  • CLAUDE.md / .cursorrules en raíz
  • Contexto pegado: pregunta · DAG · método elegido · convenciones
  • Qué NO hacer (ej: no usar TWFE clásico)
  • DECISIONS.md · log alto nivel
  • DAG H2 visible (PNG en docs/)
③ Audits · la trazabilidad
  • audit/L4-pair-programming.md (línea por línea)
  • audit/decisions.md (giros metodológicos)
  • audit/AIAS-report.md (modo por tarea)
  • audit/errors-IA.md (≥1 error detectado)
  • Markdown vivo, NO chat efímero
④ Reproducibilidad · cierres
  • set.seed(2026) en cada script
  • sessionInfo() / renv.lock / requirements.txt
  • Makefile: make all reproduce todo
  • .gitignore: data/raw/*, .env, .DS_Store
  • Plantillas: PAP.md

Tarea concreta (10 min · ahora):

  1. git init en tesis-apellido/
  2. Crear las 7 carpetas + .gitignore + Makefile vacío.
  3. Escribir CLAUDE.md / .cursorrules con 6 secciones:
    • Pregunta H1 · 1 línea
    • DAG H2 · arista principal D→Y
    • Tratamiento (random/staggered/threshold)
    • Datos disponibles (panel/cross-section)
    • Modo AIAS dominante (4 hoy)
    • Reglas duras: nada de TWFE en staggered · audit log obligatorio · 1 error de IA detectado
  4. Inicializar audit/L4-pair-programming.md con el encabezado.
  5. Commit inicial: git commit -m "setup: project structure + AI memory".

Advertencia

Por qué importa cada espacio:

  • Estructura → la IA encuentra archivos sin que tengas que pegarlos.
  • Memoria → la IA no te pregunta lo mismo 10 veces · no inventa convenciones.
  • Audits → cuando entregues H3 podés rastrear de dónde salió cada decisión.
  • Reproducibilidad → el viernes tu repo corre en el computador del JC.

Consejo

Regla operativa del aula: la IA es tu colaborador, no tu motor. Un colaborador necesita contexto persistente (memoria) y rastros de trabajo (audits). El proyecto que armás ahora — esos 4 espacios — es lo que distingue una tesis defendible de una “cosa que hizo ChatGPT por mí”.

Sprint 1 · 🎯 Del DAG al método · identificación primero

45 JC · 15 Act · 60 min · Endogeneidad → estrategias → 6 patrones DAG · cuali/mixto · 4 ejemplos · métodos al final

📍 Estructura del Sprint 1 · 8 JC + actividad

⏱️ Bloque45 JC · 15 Act · 60 min
🎯 MetaMapear endogeneidad → estrategia → DAG → método · marco conceptual + 6 patrones + cuali/mixto
📦 Artefacto“Mi DAG implica patrón X · estrategia Y · método Z · cross-check W” → encabezado del PAP H3
🧪 CheckpointPodés explicar tu fuente de endogeneidad · nombrar tu estrategia · y la implementación con su patrón DAG
1¿Qué es identificación?Pregunta fundamental · counterfactual
2Endogeneidad4 fuentes · cov(D,ε)≠0 · cuándo OLS falla
34 estrategiasRespuestas conceptuales al problema
46 patrones cuantiImplementaciones canónicas
5DAG cuali y mixtoProcess tracing · joint displays
6Patrón estrellaVariación temporal · Goodman-Bacon
🔧4 ejemplosClase clasifica
7Cuadro síntesisLos métodos como respuestas
8Tu decisiónTu DAG H2 → tu patrón → tu método primario + cross-check (entra al PAP H3 + Lab L4)

Inversión pedagógica: la mayoría de cursos enseña “DiD vs IV vs RDD” como menú de herramientas. Acá invertimos: tu DAG decide la estrategia; la estrategia tiene 1-3 implementaciones; el nombre del método es lo último que se decide.

🎓 JC 1/8 · ¿Qué es identificación causal? (4 min)

El problema fundamental (Holland 1986):

Nadie observa simultáneamente Y(1) e Y(0) para la misma unidad. El contrafactual no existe en los datos.

Identificar = recuperar E[Y(1) − Y(0)] (el ATT) a partir de datos donde solo vemos uno de los dos estados por unidad.

La pregunta operativa de Pearl:

Si dos unidades tienen el mismo valor de todos los confounders relevantes · pero distinto D · ¿por qué difieren en D?

Esa “razón por la que difieren” es la fuente de variación que identifica el efecto.

Consejo

Identificación ≠ estimación.

  • Identificación: ¿bajo qué supuestos el ATT está bien definido dado lo que observo? Decisión de diseño.
  • Estimación: ¿cómo computo numéricamente ese ATT? Decisión de software.

Si la identificación falla, la estimación más fina decora una pregunta sin respuesta.

Advertencia

Pregunta-control para tu DAG H2: mirando tu diagrama · ¿qué supuesto defendés para que el ATT esté identificado? Marcalo con un círculo. Eso es lo que vas a tener que defender el sábado 23/05.

🎓 JC 2/8 · Endogeneidad · cuándo OLS falla (5 min)

Definición técnica:

D es endógeno si cov(D, ε) ≠ 0 en el modelo Y = β·D + ε.

Cuando esto pasa, β̂_OLS NO recupera el efecto causal — recupera una mezcla de causa + ruido confundido.

Las 4 fuentes clásicas de endogeneidad:

# Fuente Mini-DAG
1 Variable omitida (OVB)
Existe U no observado que causa D y Y simultáneamente.
U → D, U → Y
2 Causalidad reversa
Y también causa D · simultaneidad.
D → Y, Y → D
3 Selección
Quién recibe D no es aleatorio · self-selection o sample selection.
U → S → muestra
4 Error de medida en D
D se mide con ruido · attenuation bias.
D ≠ D* observado

Advertencia

El test mental de 30 segundos: mirá tu pregunta H1.

  • ¿Hay algún factor no observable que afecte tanto D como Y? → endogeneidad tipo 1.
  • ¿Podría Y afectar de vuelta a D? → endogeneidad tipo 2.
  • ¿Quién recibe D se auto-selecciona o lo seleccionó el sistema? → endogeneidad tipo 3.
  • ¿Tu medida de D captura el concepto teórico o es una proxy ruidosa? → endogeneidad tipo 4.

Si respondiste SÍ a alguna, OLS sin identificación está roto para tu pregunta.

Consejo

Por qué tu DAG H2 importa: U5 te enseñó a dibujar la endogeneidad. Cada arista no-bloqueada hacia D desde un confounder ES la endogeneidad. La estrategia de identificación (próximo slide) es cómo se rompe esa arista.

🎓 JC 3/8 · 4 estrategias de identificación · respuestas al problema (5 min)

La idea central (Angrist-Pischke): una estrategia de identificación es una forma de aislar variación exógena de D — variación que existe independientemente de los confounders no observados.

Estrategia La idea Endogeneidad que cierra Supuesto clave
A · Conditioning Comparo unidades con mismo valor de X observable Solo tipo 1 si X observable Selection on observables · backdoor cerrable
B · Instrumento (IV) Uso Z que mueve D pero NO afecta Y directamente Cierra tipos 1, 2 y 3 vía Z Exclusion restriction · Z ⊥ Y | D, U
C · Discontinuidad (RDD) Comparo unidades casi iguales a ambos lados de un umbral Tipo 1 localmente · "as if random" Continuidad de Y(0) en el umbral · no manipulación
D · Variación temporal (DiD) Comparo cambio en tratados vs cambio en controles Tipo 1 si U es time-invariant Parallel trends · sin shocks diferenciados

El insight clave: cada estrategia explota un tipo distinto de variación para resolver un tipo distinto de endogeneidad. Conditioning asume que el confounder es observable ((Imbens, 2015) · (Oster, 2019)). IV asume que existe una palanca exógena ((Angrist et al., 1996) LATE · (Andrews et al., 2019) weak IV). RDD asume que un umbral institucional genera comparabilidad local ((Lee & Lemieux, 2010) · (Cattaneo et al., 2020)). DiD asume que los confounders no se mueven en el tiempo ((Roth et al., 2023)). Ninguna estrategia es universalmente mejor — el DAG H2 decide cuál aplica.

→ Próximo slide: cada estrategia tiene 1-3 implementaciones canónicas. Esos son los 6 patrones DAG + los métodos asociados. Lectura puente PO ↔︎ DAG: (Imbens, 2020) (JEL · Nobel 2021) — “the best work uses both”.

🎓 JC 4/8 · 6 patrones DAG canónicos · cuanti (8 min)

# Patrón DAG Estructura mínima Estrategia Ejemplo típico
1 Randomización R → D → Y sin backdoor Comparar medias entre brazos RCT microcrédito · evaluación experimental
2 Selección sobre observables D ← X → Y, X observable Condicionar en X (adjustment set) Educación → ingreso controlando background familiar
3 Instrumento U → D, U → Y, Z → D, Z ⊥ Y|D,U Explotar variación exógena Z Distancia a universidad como instrumento de educación
4 Discontinuidad D = 1[X ≥ c] Comparar alrededor del umbral c Cesárea por umbral de peso · beca por puntaje
5 Variación temporal ⭐ Panel · D se enciende en t* para algunos Diferencias en diferencias (DiD) 4G en Catatumbo · reforma educativa por cohortes
6 Alta dimensión observables D ← X₁..Xₚ → Y, p grande ML para nuisance functions Tratamiento heterogéneo en RCT grandes · políticas multinivel

Regla operativa: identificá tu DAG H2 con uno de estos 6 patrones (o una combinación). El patrón 5 (variación temporal) es el más común en tesis MAE y el más subtle — le dedicamos un slide entero más adelante. Pero antes: no toda tesis cabe en cuanti — el DAG también vive en cuali y mixto. Ese es el próximo slide.

Lecturas canónicas modernas por patrón (núcleo · todas con ficha):

🎓 JC 5/8 · DAG cuali y mixto · cuándo el patrón se sale del cuadro (5 min)

El DAG no es exclusivo de cuanti. Cuando tu pregunta es de mecanismo · proceso · casos · contexto, el DAG sigue siendo la herramienta — pero su función cambia.

Patrón A · Cualitativo · Process Tracing (Beach & Pedersen, 2019)

  • N pequeño (típicamente 1-5 casos) · variación imposible o irrelevante.
  • El DAG documenta la secuencia del mecanismo D → M₁ → M₂ → Y.
  • Cada arista es una predicción observable que se valida con uno de 4 tests bayesianos: straw-in-the-wind · hoop · smoking gun · doubly decisive.
  • “Identificación” no es exogeneidad — es eliminar explicaciones rivales del mecanismo.

→ Cuándo aplica: tu pregunta es “¿cómo opera el proceso?” · no “¿cuánto?”.

Patrón B · Mixto · Joint Display (Fetters, 2020) · (Creswell, 2014)

  • El DAG es el marco unificador: cuanti identifica el ATT (D→Y) · cuali valida el mecanismo (D→M y M→Y) · juntos hacen inferencia robusta.
  • 4 diseños canónicos: convergente paralelo · explicativo secuencial (cuanti→cuali) · exploratorio secuencial (cuali→cuanti) · embedded.
  • Joint display: tabla 2 columnas que integra hallazgos cuanti + cuali con meta-inferencia explícita.

→ Cuándo aplica: - Cuanti dio efecto significativo · necesitás explicar por qué. - Cuanti dio null · necesitás explorar si fue ausencia o ruido. - Confounders no observables que cuanti no puede cerrar → cuali los identifica. - Heterogeneidad por contexto que ethnography revela.

Si tu hipótesis primaria (de U5) es mecanística, exploratoria o el patrón cuanti no aplica limpio → ver el recurso asincrónico Métodos mixtos modernos (~90 min). Cubre process tracing · QCA · LLM-aided coding · joint displays · 4 diseños Creswell-Plano Clark · checklist de auditoría · y la conexión explícita con el DAG H2. Lectura para martes 20/05 si tu tesis va por ese lado.

🎓 JC 6/8 · Patrón estrella · variación temporal y Goodman-Bacon (8 min)

Por qué este patrón merece atención especial:

  • Es el más común en evaluación de políticas LATAM.
  • El DAG parece simple (panel + tratamiento que se enciende) — pero la implementación tiene una trampa famosa.
  • TWFE clásico (regresión con efectos fijos de unidad y tiempo) parecía la solución natural · post-2018 sabemos que está roto.

El teorema demoledor de Goodman-Bacon 2021 (Goodman-Bacon, 2021):

Cuando hay tratamiento escalonado (distintos grupos tratados en distintos momentos) + efectos heterogéneos, el coeficiente TWFE es un promedio ponderado de comparaciones 2×2 con pesos negativos.

→ Implicación práctica: TWFE puede dar el signo equivocado de un efecto real.

❌ TWFE clásicoSólo seguro cuando: 1 grupo tratado en 1 momento. Si hay staggered → pesos negativos · sesgo.
✅ Callaway-Sant'AnnaEstima ATT(g,t) por cohorte de tratamiento · agrega con pesos transparentes. Software: did en R.
✅ de Chaisemartin-D'HDIDM · estimador robusto a efectos heterogéneos. Software: DIDmultiplegt en Stata/R.
✅ Sun-AbrahamEvent-study con cohort-specific interactions · resuelve contaminación de ATT.
✅ Borusyak-Jaravel-SpiessImputation estimator · eficiente bajo paralelismo.

Advertencia

Regla dura del aula: si tu DAG implica staggered DiD → NUNCA entregues TWFE sin haber corrido al menos 1 estimador moderno como cross-check. Brodeur 2020 (Brodeur et al., 2020) mostró que IV/DiD son los métodos más p-hackeados — el cross-check es la disciplina mínima.

Los otros 5 patrones cuanti (1, 2, 3, 4, 6) también tienen sus trampas — pero el de variación temporal es el que más papers MAE rompe. Por eso le dedicamos esta sección. Los métodos modernos (CS, CDH, SA, BJS) los retomamos en JC 7/8 como parte del cuadro síntesis.

🔧 Actividad S1 · 4 ejemplos · clasificá DAG → estrategia → método (15 min)

⏱️ S1 · Ejemplos 15:00

Formato: parejas · 2 min por caso (8 min) · 5 min plenario · 2 min síntesis.

# Caso Pregunta causal ¿Qué patrón? ¿Qué método?
A 4G en Catatumbo ¿La apertura de tramos 4G aumenta el empleo formal municipal? Datos panel anuales · distintos pueblos tratados en distintos años. _____________
B Microcrédito BancaMía ¿Recibir un microcrédito aumenta los ingresos del hogar? 2.000 hogares asignados aleatoriamente a recibir/no recibir · 1 momento. _____________
C Cesárea automática ¿La cesárea automática reduce mortalidad neonatal? Los hospitales aplican cesárea si peso al nacer < 2.500g · cross-section de 50.000 nacimientos. _____________
D Reforma agraria Bolivia 2009 ¿La reforma agraria boliviana redujo la concentración de tierras? Bolivia tratada · resto LATAM como controles · panel anual 1990-2024. _____________

Consejo

Plantilla de respuesta (1 línea por caso):

“Caso A: patrón [N°] (nombre) · estrategia [exogeneidad / condicionamiento / DiD / RDD / IV] · método primario [OLS / CS / RDD / Synthetic / …] · cross-check con [método secundario].”

Respuestas + papers análogos (revelar al final · lecturas modernas para los 4 ejemplos):

🎓 JC 7/8 · Los métodos como respuestas · cuadro síntesis (10 min)

Patrón DAG Estrategia Método primario Cross-check / robustez Software
1. Randomización Comparar medias OLS · ITT/ATE [@AtheyImbens2017Handbook] Randomization inference · stratified balance [@BruhnMcKenzie2009] fixest · ri2
2. Sel. observables Condicionar en X OLS + controles · CEM [@IacusKingPorro2012] · PSM [@Imbens2015Matching] Oster δ [@Oster2019] · DR/DML [@Chernozhukov2018DML] cem · MatchIt · robomit
3. Instrumento Explotar Z exógeno 2SLS · LATE [@AngristImbensRubin1996] Weak-IV F > 104.7 [@AndrewsStockSun2019] · Anderson-Rubin · MTE [@MogstadTorgovitskyWalters2024] ivreg · ivmodel · ivmte
4. Discontinuidad Local randomization RDD sharp/fuzzy local-linear [@CattaneoIdroboTitiunik2020] Robust CI [@CalonicoCattaneoTitiunik2014] · McCrary moderno · placebos rdrobust · rddensity
5a. DiD 2×2 DiD clásico TWFE (sólo 1 grupo · 1 momento) Event-study · placebos pre-trends fixest
5b. DiD staggered DiD moderno CS · CDH · SA · BJS ≥2 estimadores en paralelo · Honest DiD (Rambachan-Roth) did · DIDmultiplegt
5c. 1 tratado Counterfactual sintético Synthetic Control · SDID Placebo in-space · in-time · permutation Synth · synthdid
6. Alta dimensión ML para nuisance DML (Chernozhukov) · Causal Forest (Athey-Wager) Múltiples seeds · sample splitting · validation DoubleML · grf

El insight central: el nombre del método NO es lo importante. Lo importante es la estrategia de identificación que tu DAG implica. Una vez que la estrategia está clara, los métodos son implementaciones intercambiables — por eso siempre corrés ≥2 como cross-check.

🎓 JC 8/8 · Tu DAG H2 → tu estrategia → tu método (8 min)

Decisión personal · 7 pasos en papel · 5 min:

  1. Releé tu DAG H2 (anoche · U5).
  2. Identificá la arista D → Y principal.
  3. ¿De dónde viene la variación exógena de D? (las 4 fuentes del JC 1).
  4. Clasificá el patrón (1, 2, 3, 4, 5a/b/c, 6).
  5. Nombre la estrategia de identificación.
  6. Nombre el método primario.
  7. Nombre el método de cross-check (de la misma estrategia · ≠ primario).

Consejo

Output esperado (1 línea · al encabezado del PAP H3):

“Mi DAG H2 implica patrón [N°] (variación temporal staggered) · estrategia DiD moderna · método primario Callaway-Sant’Anna porque [datos · multiple-period · cohortes claras] · cross-check con de Chaisemartin-D’H porque [robustez a heterogeneidad].”

→ Esta frase entra al PAP H3 del viernes (22/05) y es el input directo al Lab L4 (Sprint 2 · ahora).

Advertencia

Si tu decisión es “TWFE clásico” sin haber identificado el patrón ni nombrado un cross-check → la decisión está mal. Re-leé JC 6/8.

Lo que se llevan del Sprint 1: el método NO es un menú · es la respuesta operativa a tu DAG. Sprint 2 (Lab L4) es escribir el código que tu decisión de hoy implica · con IA auditada línea por línea.

☕ Break · 10 min · de la decisión al código

Café · estiramiento · verificá Copilot/Cursor activos · abrí el repo H2 · prepará tu DAG en pantalla — el Lab L4 arranca corriendo

Sprint 2 · 🤝 Lab L4 · Pair Programming Aumentado

20 JC · 70 Act · 90 min · IA escribe · vos auditás línea por línea

📍 Estructura del Sprint 2 · Lab L4 (90 min)

⏱️ Bloque20 JC · 70 Act · 90 min
🎯 MetaImplementar event-study staggered (o el método que el Sprint 1 decidió) con IA como copiloto auditado · 2 estimadores + audit log denso
📦 ArtefactoScript reproducible + audit log L4 con prompts + decisiones + ≥1 error de IA detectado · Modo AIAS 4 explícito
🧪 CheckpointPodés ejecutar tu script en otro computador · explicar cada línea · mostrar al menos 2 estimadores convergiendo (o divergiendo y explicando por qué)
1Reglas del Lab L4Inversión humano/IA · audit denso · errores esperados
2Prompt estructuradoPlantilla para Copilot/Claude (materiales)
3Audit log templatePrompt · output · decisión · justificación
🔧Implementación · 60 minEvent-study + cross-check + diagnostics
📋Cierre · 10 minCommit · audit log lleno · paquete listo para Sprint 3

🎓 JC 1/4 · Reglas duras del Lab L4 · evidencia empírica (5 min)

El contrato del Lab L4 (no negociable):

  1. 🤖 La IA implementa · 👤 vos auditás. Si no podés explicar una línea en 30 seg → la rechazás · refactorizás · o te detenés.
  2. 📝 Audit log denso. Cada prompt + output + decisión queda en audit/L4-pair-programming.md. Sin audit no hay entrega.
  3. 🔍 ≥1 error introducido por IA debe ser detectado y documentado. Si no lo encontraste, no auditaste.
  4. 🔁 Cross-check obligatorio. ≥2 estimadores (CS · CDH · BJS). Convergencia gana confianza.
  5. 🔢 Semilla fija + sessionInfo + git commit por bloque. Reproducibilidad desde el byte 1.

Consejo

Evidencia empírica (no es teoría):

  • Productividad +55.8% en tareas codificables (Peng et al., 2023) · RCT con 95 devs · GitHub Copilot.
  • Jagged frontier (Dell’Acqua et al., 2023) · ganancia 0 o negativa en tareas fuera de la frontera de capacidad.
  • Zona 🟢 augmentación (Bail, 2024) · pair coding está aquí · NO en 🔴 reemplazo.

Advertencia

5 errores de IA documentados:

  • 🚫 Hallucination de paquete (inventa libraries)
  • 🚫 Hallucination de función (argumentos incorrectos)
  • 🚫 Spec drift silencioso (cluster=NULL “para simplificar”)
  • 🚫 Type coercion (factor → numeric · output basura)
  • 🚫 Identificación rota (mediador como control sin avisar)

→ Documentá ≥1 en tu audit. “La IA no se equivocó” = re-leé con suspicacia.

🎓 JC 2/4 · El prompt estructurado para pair programming (5 min)

Plantilla (en materiales/prompt-pair-programming.md):

# CONTEXTO
- Lenguaje: R (tidyverse + did + fixest)
- Datos: panel municipal · 2010-2022 · n=1100
- Tratamiento: post_4G (staggered · 2014-2022)
- Outcome: tasa_ocupacion (continua)
- DAG H2: Pavimento → Empleo (confounders: Z₁, Z₂)

# TAREA
Implementar event-study con Callaway-Sant'Anna:
1. Verificar tipos de columnas (id, time, treat)
2. Estimar ATT(g,t) con never-treated como control
3. Agregar a dynamic event-study
4. Plot con ggdid
5. Sin pre-treatment leads ≥ 4 periodos

# RESTRICCIONES
- No instalar paquetes nuevos sin confirmar
- Reportar warning() en consola si encuentra NA
- Comentar cada decisión metodológica

# ENTREGABLE
Script `code/01_did_cs.R` con
sessionInfo() y semilla 2026.

Consejo

Por qué este prompt funciona:

  • CONTEXTO te ata al DAG H2 — la IA no inventa controles.
  • TAREA es operativa · pasos numerados.
  • RESTRICCIONES atan a la IA a tus reglas.
  • ENTREGABLE define el output concreto.

→ Sin esta estructura, la IA improvisa · y improvisar es donde aparecen los 5 errores del slide anterior.

Advertencia

Trampa común: pegar el prompt y aceptar el output. No. Después del primer output, pedí:

“Antes de aceptar, explicame línea por línea qué hace y qué supuestos asume.”

Eso entra al audit log.

🎓 JC 3/4 · El audit log L4 · cómo se ve (5 min)

Estructura por entrada:

# Hora Prompt enviado (resumen) Output recibido (esencia) Decisión Justificación / acción
01 09:42 "Implementá CS event-study staggered con never-treated como control · panel.csv" Sugiere did::att_gt(...,control_group="nevertreated") + agregación dinámica + plot ✅ ACEPTAR Verifico clase de id (factor), tipo de time (int), gname correcto. Corro · plot razonable. Commit.
02 09:55 "Añadí CDH con DIDmultiplegt para cross-check" Sugiere did_multiplegt(...,placebo=4) pero omite argumento dynamic=4 ⚠️ EDITAR Sin dynamic, no comparable al event-study de CS. Lo añado manualmente. Documento.
03 10:08 "¿Cómo manejo unbalanced panel?" Sugiere na.omit() en todo el panel ❌ RECHAZAR ERROR DETECTADO: drop indiscriminado introduce sesgo selección. Pedir versión con panel = "unbalanced".

Advertencia

Mínimo de entradas para H3: ~15–25 prompts auditados. Calidad > cantidad — preferí 15 con justificación densa que 50 con “✅ ACEPTAR” sin comentario.

🎓 JC 4/4 · Picker de parejas + arranque (5 min)

— click ▶ —

Estructura del Lab L4 (60 min de implementación + 10 cierre):

Min Actividad
0–10 Sentarse en parejas · compartir DAG H2 + decisión Sprint 1
10–30 Implementar estimador primario (CS · CDH · SC · etc.)
30–50 Implementar estimador secundario (cross-check)
50–60 Diagnósticos (Goodman-Bacon · pre-trends · placebos)
60–70 Cierre: commit · audit log completo · cross-check escrito

Consejo

Rol del compañero/a de pareja:

  • 👀 2do auditor — revisa tu audit log mientras vos codeás.
  • 🧠 Devil’s advocate — pregunta “¿por qué aceptaste eso?” cada 10 min.
  • 🤝 NO co-implementa — cada uno tiene su PAP/DAG/método.

→ Reglas idénticas al Lab L3, pero con código en lugar de DAG.

Advertencia

Si tu pareja no llegó hoy → trabajás solo · al final del Lab L4 pedís a JC un auditor cruzado de otra pareja durante el Sprint 3.

🔧 Lab L4 · 60 min implementación + 10 cierre

⏱️ S2 · Lab L4 70:00

Stack sugerido R:

library(did)            # CS
library(DIDmultiplegt)  # CDH
library(fixest)         # SA via sunab()
library(bacondecomp)    # diagnóstico
library(HonestDiD)      # sensitivity
library(tidyverse)      # datos
library(modelsummary)   # tablas

Stack sugerido Python:

import differences as dif  # CS in Python
import linearmodels as lm
import pyfixest as pf
import causalml
import pandas as pd
import statsmodels.formula.api as smf

Plantilla R abreviada (materiales/plantilla-DiD-eventstudy.R):

set.seed(2026)
panel <- read_csv("data/panel.csv")

# 1. Diagnóstico Goodman-Bacon
bd <- bacon(y ~ post_treat, panel,
            id_var="id", time_var="t")

# 2. CS · primario
att <- did::att_gt(yname="y", tname="t",
                   idname="id", gname="gtreat",
                   data=panel)
es  <- did::aggte(att, type="dynamic")

# 3. CDH · cross-check
cdh <- DIDmultiplegt::did_multiplegt(
  panel, "y", "id", "t", "post_treat",
  placebo=4, dynamic=4)

# 4. Comparar + plot
modelsummary(list(CS=es, CDH=cdh),
             output="output/tab_did.tex")

Advertencia

Reglas durante el Lab: 1) Audit log abierto y actualizado en vivo. 2) Cada error de IA detectado → entrada en audit con etiqueta [ERROR_IA]. 3) Si la IA propone una especificación (no sólo sintaxis), vos decidís — eso NO se delega.

🔧 Buffer de programación · 5 min · cerrá tu código

Sin café · sigan programando. Estos 5 min son para terminar el último chunk del Lab L4 y dejar 1 sola pantalla con: tu PAP draft · audit log al día · output principal a la vista. En 5 minutos 3 pares juzgan tu identificación — necesitan ver el código corriendo, no buscar archivos.

Sprint 3 · ⚔️ Adversarial Workshop + Replication Court

10 JC · 70 Act · 80 min · 3 pares juzgan tu identificación antes que el jurado real

📍 Estructura del Sprint 3 (80 min)

⏱️ Bloque10 JC · 70 Act · 80 min
🎯 MetaSometer tu PAP + código a escrutinio adversarial entre pares · veredicto firmado · respuesta del autor
📦 ArtefactoActa del Replication Court (1 por estudiante) con: revisión de identificación · revisión de código · 3 ataques al supuesto principal · respuesta del autor
🧪 CheckpointVos podés defender tu identificación contra al menos 2 ataques específicos · y nombrar 1 vulnerabilidad real que vas a corregir en el lockdown H3
1Por qué Replication CourtBrodeur 2020 · el método predice el p-hacking
2Protocolo de la corte3 roles · 4 fases · acta firmada
🔧3 rondas · 70 minCada estudiante juzga 2 · es juzgado 1
📋SíntesisVulnerabilidades para el lockdown H3

🎓 JC 1/2 · Por qué Replication Court · Brodeur 2020 (5 min)

(Brodeur et al., 2020) · Methods matter — p-hacking and publication bias in causal analysis in economics:

Análisis de ~22.000 t-statistics de 25 revistas top muestra exceso sistemático de p-valores justo abajo de 0.05 — y el exceso depende del método:

  • RCT: poco exceso (lock-in fuerte).
  • RDD: poco exceso (visualización forzosa).
  • DiD: alto exceso (specification flexibility).
  • IV: muy alto exceso (instrument flexibility).

Advertencia

Implicación normativa:

El método que elegís predice el riesgo de p-hacking que vas a enfrentar.

→ Si tu método es DiD o IV, el escrutinio adversarial es especialmente importante. No porque vos seas tramposo, sino porque la flexibilidad de especificación es estructural.

→ El Replication Court es la versión pedagógica del peer review previa a la sustentación.

Consejo

Spirit of moderation: este sprint no busca destruir tu PAP — busca fortalecerlo contra ataques predecibles, antes de que aparezcan en U8.

🛠️ Las 2 herramientas modernas de transparencia (bonus · 3 min)

Antes de que los jueces ataquen, podés blindar tu PAP con dos técnicas frontier 2020+:

📊 Specification Curve (Simonsohn et al., 2020)

Enumerá todas las especificaciones razonables (controles · clusters · medidas), corré las N, plotealas ordenadas. Si la mayoría es del mismo signo → robustez alta.

library(specr)
setup <- setup(data, y, x,
  controls = c("c1","c2","c3"),
  subsets = list(region = c("A","B")))
spec_curve <- specr(setup)
plot(spec_curve)

→ Output: curva + decomposicional de qué decisión mueve más.

🌌 Multiverse Analysis (Steegen et al., 2016)

Enumerá todas las decisiones razonables sobre el dataset (filtros · missing · outliers · codificación), generá la matriz de datasets, corré tu análisis en todos.

→ Output: histograma de p-values + curva de coeficientes a través de los N datasets.

Pareja perfecta con spec curve: multiverse maneja decisiones de datos; spec curve maneja decisiones de modelo.

Advertencia

Por qué importa hoy: (Munafò et al., 2017) · el manifesto canónico de open science 2017 — pre-registración + spec curve + multiverse + open data + replication = el stack 2026 de transparencia. Si tu PAP no incluye al menos 1 de estas técnicas modernas, el Replication Court te lo va a marcar.

🎓 JC 2/2 · Protocolo del Replication Court (5 min)

👤 AUTOR Presenta su PAP + código (5 min).
Responde preguntas (5 min).
Acepta veredicto + 3 ataques.
Firma acta + plan de remediación.
⚖️ 3 JUECES (pares) Revisan identificación (DAG↔método).
Revisan código (audit log L4).
Proponen 3 ataques al supuesto principal.
Votan veredicto: ✅ defendible · ⚠️ con caveats · ❌ rechazado.
📋 SECRETARIO/A Toma acta · transcribe los 3 ataques.
Cronometra fases.
Asegura que el autor escuche sin interrumpir en fase 2.
Entrega acta firmada al final.

4 fases por ronda (≈20 min cada una):

Min Fase Quién habla
0–5 Presentación del PAP 👤 Autor (DAG · método · identificación · placebos · sensitivity)
5–12 Escrutinio + 3 ataques ⚖️ Jueces (autor calla · secretario/a transcribe)
12–15 Respuesta del autor 👤 Autor (acepta · refuta · marca para remediación)
15–20 Veredicto + acta firmada ⚖️ Jueces votan · 📋 secretario/a entrega acta

→ Cada estudiante juega autor 1 vez · juez 2 veces · secretario/a 1 vez (rotación).

🔧 Replication Court · 3 rondas · picker

⏱️ S3 · Replication Court 70:00
— click ▶ —

Las 3 rondas (≈22 min cada una):

Ronda Autor Jueces Secretario/a
1 Picker 2 picker 1 picker
2 Rotación Rotación Rotación
3 Rotación Rotación Rotación

→ Al final de la 3ra ronda, todos jugaron 1 vez de autor.

Consejo

Plantilla del acta (materiales/replication-court-template.md):

# Acta Replication Court · Ronda __
Autor: __ · Jueces: __, __

## PAP presentado (esencia)
__

## 3 ataques al supuesto principal
1. __ (juez 1)
2. __ (juez 2)
3. __ (consenso)

## Respuesta del autor
__

## Veredicto: ✅ / ⚠️ / ❌

## Plan de remediación (lockdown H3)
- [ ] __
- [ ] __

Firmas: ____ ____ ____

Advertencia

Reglas duras: 1) Autor calla en fase 2 (escrutinio) · 2) Jueces atacan el supuesto, no la persona · 3) Acta firmada va al audit log como evidencia del juicio adversarial · 4) Veredicto NO afecta la nota — la calidad del audit + remediación sí.

Sprint 4 · 🏁 H3 Lockdown · ASINCRÓNICO

Roadmap para el trabajo en casa · entrega viernes 22/05 · 23:59

📍 Estructura del Sprint 4 · 🏁 H3 asincrónico

Advertencia

Este sprint NO se hace en aula. El lockdown vive en casa entre martes 21:00 y viernes 22/05 · 23:59. Lo que sigue es el roadmap que cierra la sesión de hoy.

⏱️ BloqueAsincrónico · ~4-6h distribuidas · entrega viernes 22/05 · 23:59
🎯 MetaCerrar PAP moderado v1 · integrar veredicto del Replication Court · empaquetar audit log L4 · commit · submit
📦 ArtefactoCarpeta H3 con: PAP.md · script reproducible · audit log L4 · acta Replication Court · reporte AIAS · ≥2 estimadores
🧪 CheckpointTu repo corre make all (o equivalente) en otro computador y reproduce los outputs del PAP
① Releer veredicto5 min · ¿qué ataques fueron justificados? · qué corregís
② Integrar al PAP20 min · sensitivity nueva · placebo nuevo · supuesto reformulado
③ Re-ejecutar15 min · script + cross-check con la corrección integrada
④ Empaquetar15 min · audit log final · reporte AIAS · README del repo
⑤ Submit · 23:59Commit · push · email con link al repo · sello AIAS modo 4

🎓 Lo que entregás · checklist final (5 min)

Carpeta de entrega H3_apellido/:

H3_apellido/
├── README.md           ← orientación al revisor
├── PAP_moderado.md     ← documento principal
├── code/
│   ├── 01_diagnostico.R
│   ├── 02_did_primario.R
│   ├── 03_did_crosscheck.R
│   ├── 04_placebos.R
│   └── 05_sensitivity.R
├── output/
│   ├── tab_did.tex
│   ├── fig_eventstudy.pdf
│   └── fig_bacon.pdf
├── audit/
│   ├── L4-pair-programming.md
│   ├── replication-court-acta.md
│   └── AIAS-report.md
└── sessionInfo.txt

Consejo

Checklist H3 (PAP moderado + Lab L4 · 20%):

  • ✅ PAP con 8 secciones canónicas Banerjee-Duflo
  • ✅ Identificación justificada contra el DAG H2
  • ✅ ≥2 estimadores modernos (no TWFE solo)
  • ✅ Goodman-Bacon decomposition reportada
  • ✅ ≥1 placebo + ≥1 sensitivity
  • ✅ Pre-trends discutidos (Honest DiD si dudas)
  • ✅ Audit log L4 con ≥15 entradas + ≥1 [ERROR_IA]
  • ✅ Acta Replication Court con remediación
  • ✅ Reporte AIAS modo 4 explícito
  • ✅ Reproducible (make all o equivalente)

🔧 Lockdown asincrónico · ~4h distribuidas hasta viernes 22/05 · 23:59

Plan sugerido (distribuilo a tu ritmo · 4 sesiones de ~1h):

  1. (30 min · miércoles) Releé el acta del Replication Court · marcá los 1-2 ataques que vas a incorporar antes del submit.
  2. (60 min · jueves) Editá el PAP: nueva sección de sensitivity · placebo nuevo · supuesto reformulado.
  3. (60 min · viernes) Re-ejecutá script con la corrección. Verifica make all (o Rscript code/01..05.R).
  4. (45 min · viernes AM) Audit log final: añadí entrada por cada cambio post-court. Reporte AIAS.
  5. (15 min · viernes PM) README del repo + commit + push antes de las 23:59.

Advertencia

Reglas duras del lockdown:

  • 🔒 NO cambiás identificación radical en lockdown — el método ya se decidió.
  • ✅ SÍ añadís sensitivity · placebos · clarificás supuestos.
  • 📝 Cada cambio post-court entra al audit con etiqueta [POST_COURT].
  • 🤖 IA puede ayudar a redactar texto del PAP — sigue siendo modo 4 auditado.
  • 🚫 NO dejás el audit log para el final · va en vivo.

Consejo

Antes de 23:59: rodá una última vez make all. Si falla en otro computador (probalo con un compañero/a), volvé y arreglá.

Cierre

Lo que se llevan

Conceptual: - El método se elige por la pregunta · no por la moda. - TWFE clásico está roto con tratamiento escalonado (Goodman-Bacon, 2021). - CS · CDH · SA · BJS son canon moderno (Roth et al., 2023). - LLMs como datos = nuevo problema de medida (Ludwig et al., 2025). - PAP moderado = punto medio entre lock-in y post-hoc (Banerjee et al., 2020).

Operativo: - Goodman-Bacon decomposition obligatoria. - ≥2 estimadores como robustez · convergencia / divergencia documentada. - Lab L4 con audit log denso · ≥1 [ERROR_IA] detectado. - Replication Court · acta firmada · remediación trackeable.

Crítico: - p-hacking diferencial por método (Brodeur et al., 2020). - Pre-trends ≠ identificación (Roth et al., 2023). - LLMs introducen researcher degrees of freedom (Ludwig et al., 2025). - Reproducibilidad es estándar mínimo (Christensen & Miguel, 2018). - Jagged frontier: la IA se equivoca donde vos no la ves (Dell’Acqua et al., 2023).

Próximo (martes 19/05 · U7 online · 3h): - 📊 Comunicación + póster Quarto · Lab L5 (auditoría de prompts en thread). - 🎯 Cierre con peer review formal asincrónico. - 🏁 H4 (35%) + Peer (10%) — la sustentación viene la siguiente.

Pregunta de cierre

Si tu examinador en U8 te pregunta “¿qué hizo la IA por vos que vos no hiciste?” · ¿qué respondés sin que se vea como confesión de fraude — y sin que se vea como negación deshonesta?

Lecturas mínimas para el fin de semana

Nota

Para el domingo:

  1. (Roth et al., 2023) — sec. 6 (recomendaciones aplicadas) + tabla de software. 5 páginas. Ficha: Roth2023.md.
  2. (Banerjee et al., 2020) — In praise of moderation. PAP que vas a refinar para U7 si hace falta.
  3. (Brodeur et al., 2020) — sec. 5 (recomendaciones de transparency). Ficha: Brodeur2020.md.

Si tenés 30 min más:

Advertencia

🏁 ENTREGA H3 · viernes 22/05 · 23:59 · 20% de la nota final.

→ Repositorio Git con la estructura del checklist · email con link a JC · sello AIAS modo 4 explícito.

→ U7 (martes 19/05 online · 3h) abre con feedback grueso de H3 en los primeros 10 min.

Conversar con el corpus de la unidad

💬 NotebookLM · Unidad 6

NotebookLM tiene cargadas todas las lecturas · slides · notas de esta unidad. Pregúntale conceptos · citas · conexiones · responde con referencia al material.

Abrir NotebookLM →

Requiere cuenta de Google. La conversación con el bot es parte del experimento: usar IA² para aprender IA².

Recordatorio · regla del aula

Si la IA escribió tu código y vos no lo auditaste línea por línea,

ese código no es tuyo · ese paper no es defendible · ese PhD no es real.

🎯 Modo AIAS 4 hoy = full support auditada. 🤖 La IA implementa · 👤 vos auditás · 📝 audit log denso · ⚖️ pares juzgan · 🏁 H3 sellado a las 23:59.

Abadie, A. (2021). Using Synthetic Controls: Feasibility, Data Requirements, and Methodological Aspects. Journal of Economic Literature, 59(2), 391-425. https://doi.org/10.1257/jel.20191450
Almond, D., Doyle, J. J., Kowalski, A. E., & Williams, H. (2010). Estimating marginal returns to medical care: Evidence from at-risk newborns. Quarterly Journal of Economics, 125(2), 591-634. https://doi.org/10.1162/qjec.2010.125.2.591
Andrews, I., Stock, J. H., & Sun, L. (2019). Weak instruments in instrumental variables regression: Theory and practice. Annual Review of Economics, 11, 727-753. https://doi.org/10.1146/annurev-economics-080218-025643
Angrist, J. D., Imbens, G. W., & Rubin, D. B. (1996). Identification of causal effects using instrumental variables. Journal of the American Statistical Association, 91(434), 444-455. https://doi.org/10.1080/01621459.1996.10476902
Arkhangelsky, D., Athey, S., Hirshberg, D. A., Imbens, G. W., & Wager, S. (2021). Synthetic difference-in-differences. American Economic Review, 111(12), 4088-4118. https://doi.org/10.1257/aer.20190159
Asher, S., & Novosad, P. (2020). Rural roads and local economic development. American Economic Review, 110(3), 797-823. https://doi.org/10.1257/aer.20180268
Athey, S., & Imbens, G. W. (2017). The Econometrics of Randomized Experiments. En A. V. Banerjee & E. Duflo (Eds.), Handbook of Field Experiments (Vol. 1, pp. 73-140). North-Holland. https://doi.org/10.1016/bs.hefe.2016.10.003
Athey, S., & Imbens, G. W. (2019). Machine Learning Methods That Economists Should Know About. Annual Review of Economics, 11, 685-725. https://doi.org/10.1146/annurev-economics-080217-053433
Bail, C. A. (2024). Can Generative AI improve social science? Proceedings of the National Academy of Sciences, 121(21), e2314021121. https://doi.org/10.1073/pnas.2314021121
Banerjee, A., Duflo, E., Finkelstein, A., Katz, L. F., Olken, B. A., & Sautmann, A. (2020). In Praise of Moderation: Suggestions for the Scope and Use of Pre-Analysis Plans for RCTs in Economics (NBER Working Paper 26993). National Bureau of Economic Research. https://doi.org/10.3386/w26993
Banerjee, A., Karlan, D., & Zinman, J. (2015). Six randomized evaluations of microcredit: Introduction and further steps. American Economic Journal: Applied Economics, 7(1), 1-21. https://doi.org/10.1257/app.20140287
Beach, D., & Pedersen, R. B. (2019). Process-Tracing Methods: Foundations and Guidelines (2nd ed.). University of Michigan Press.
Borusyak, K., Jaravel, X., & Spiess, J. (2024). Revisiting event-study designs: Robust and efficient estimation. Review of Economic Studies, 91(6), 3253-3285. https://doi.org/10.1093/restud/rdae007
Brodeur, A., Cook, N., & Heyes, A. (2020). Methods Matter: \(p\)-Hacking and Publication Bias in Causal Analysis in Economics. American Economic Review, 110(11), 3634-3660. https://doi.org/10.1257/aer.20190687
Bruhn, M., & McKenzie, D. (2009). In pursuit of balance: Randomization in practice in development field experiments. American Economic Journal: Applied Economics, 1(4), 200-232. https://doi.org/10.1257/app.1.4.200
Callaway, B., & Sant’Anna, P. H. C. (2021). Difference-in-Differences with Multiple Time Periods. Journal of Econometrics, 225(2), 200-230. https://doi.org/10.1016/j.jeconom.2020.12.001
Calonico, S., Cattaneo, M. D., & Titiunik, R. (2014). Robust nonparametric confidence intervals for regression-discontinuity designs. Econometrica, 82(6), 2295-2326. https://doi.org/10.3982/ECTA11757
Cattaneo, M. D., Idrobo, N., & Titiunik, R. (2020). A Practical Introduction to Regression Discontinuity Designs: Foundations. Cambridge University Press. https://doi.org/10.1017/9781108684606
Chernozhukov, V., Chetverikov, D., Demirer, M., Duflo, E., Hansen, C., Newey, W., & Robins, J. (2018). Double/debiased machine learning for treatment and structural parameters. Econometrics Journal, 21(1), C1-C68. https://doi.org/10.1111/ectj.12097
Christensen, G., & Miguel, E. (2018). Transparency, Reproducibility, and the Credibility of Economics Research. Journal of Economic Literature, 56(3), 920-980. https://doi.org/10.1257/jel.20171350
Cinelli, C., Forney, A., & Pearl, J. (2024). A Crash Course in Good and Bad Controls. Sociological Methods and Research, 53(3), 1071-1104. https://doi.org/10.1177/00491241221099552
Creswell, J. W. (2014). Research Design: Qualitative, Quantitative, and Mixed Methods Approaches (4th ed.). SAGE Publications.
Cunningham, S. (2021). Causal Inference: The Mixtape. Yale University Press.
de Chaisemartin, C., & D’Haultfœuille, X. (2020). Two-Way Fixed Effects Estimators with Heterogeneous Treatment Effects. American Economic Review, 110(9), 2964-2996. https://doi.org/10.1257/aer.20181169
Dell’Acqua, F., McFowland III, E., Mollick, E. R., Lifshitz-Assaf, H., Kellogg, K., Rajendran, S., Krayer, L., Candelon, F., & Lakhani, K. R. (2023). Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality (Working Paper 24-013). Harvard Business School.
Fetters, M. D. (2020). The Mixed Methods Research Workbook: Activities for Designing, Implementing, and Publishing Projects. SAGE Publications.
Goodman-Bacon, A. (2021). Difference-in-Differences with Variation in Treatment Timing. Journal of Econometrics, 225(2), 254-277. https://doi.org/10.1016/j.jeconom.2021.03.014
Huntington-Klein, N. (2022). The Effect: An Introduction to Research Design and Causality. Chapman & Hall/CRC. https://doi.org/10.1201/9781003226055
Iacus, S. M., King, G., & Porro, G. (2012). Causal inference without balance checking: Coarsened exact matching. Political Analysis, 20(1), 1-24. https://doi.org/10.1093/pan/mpr013
Imbens, G. W. (2015). Matching methods in practice: Three examples. Journal of Human Resources, 50(2), 373-419. https://doi.org/10.3368/jhr.50.2.373
Imbens, G. W. (2020). Potential outcome and directed acyclic graph approaches to causality: Relevance for empirical practice in economics. Journal of Economic Literature, 58(4), 1129-1179. https://doi.org/10.1257/jel.20191597
Lee, D. S., & Lemieux, T. (2010). Regression discontinuity designs in economics. Journal of Economic Literature, 48(2), 281-355. https://doi.org/10.1257/jel.48.2.281
Ludwig, J., Mullainathan, S., & Rambachan, A. (2025). Large Language Models: An Applied Econometric Framework (NBER Working Paper 33344). National Bureau of Economic Research. https://doi.org/10.3386/w33344
Mogstad, M., Torgovitsky, A., & Walters, C. R. (2024). Inference for causal effects of instrumental variables: The local average treatment effect. Quarterly Journal of Economics. https://www.nber.org/papers/w32021
Munafò, M. R., Nosek, B. A., Bishop, D. V. M., Button, K. S., Chambers, C. D., Percie du Sert, N., Simonsohn, U., Wagenmakers, E.-J., Ware, J. J., & Ioannidis, J. P. A. (2017). A manifesto for reproducible science. Nature Human Behaviour, 1(1), 0021. https://doi.org/10.1038/s41562-016-0021
Oster, E. (2019). Unobservable selection and coefficient stability: Theory and evidence. Journal of Business and Economic Statistics, 37(2), 187-204. https://doi.org/10.1080/07350015.2016.1227711
Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidence from GitHub Copilot. https://arxiv.org/abs/2302.06590
Perkins, M., Furze, L., Roe, J., & MacVaugh, J. (2024). The AI Assessment Scale (AIAS): A Framework for Ethical Integration of Generative AI in Educational Assessment. Journal of University Teaching and Learning Practice, 21(6). https://doi.org/10.53761/q3azde36
Rambachan, A., & Roth, J. (2023). A more credible approach to parallel trends. Review of Economic Studies, 90(5), 2555-2591. https://doi.org/10.1093/restud/rdad018
Roth, J., Sant’Anna, P. H. C., Bilinski, A., & Poe, J. (2023). What’s Trending in Difference-in-Differences? A Synthesis of the Recent Econometrics Literature. Journal of Econometrics, 235(2), 2218-2244. https://doi.org/10.1016/j.jeconom.2023.03.008
Simonsohn, U., Simmons, J. P., & Nelson, L. D. (2020). Specification curve analysis. Nature Human Behaviour, 4(11), 1208-1214. https://doi.org/10.1038/s41562-020-0912-z
Steegen, S., Tuerlinckx, F., Gelman, A., & Vanpaemel, W. (2016). Increasing transparency through a multiverse analysis. Perspectives on Psychological Science, 11(5), 702-712. https://doi.org/10.1177/1745691616658637
Sun, L., & Abraham, S. (2021). Estimating dynamic treatment effects in event studies with heterogeneous treatment effects. Journal of Econometrics, 225(2), 175-199. https://doi.org/10.1016/j.jeconom.2020.09.006
Wager, S., & Athey, S. (2018). Estimation and inference of heterogeneous treatment effects using random forests. Journal of the American Statistical Association, 113(523), 1228-1242. https://doi.org/10.1080/01621459.2017.1319839
15:00