Lab IA²-4 · Pair programming aumentado

Sesión S06 · Copilot como compañero, humano como auditor

Autor/a
Afiliación

Juan Carlos Muñoz-Mora, PhD

Universidad EAFIT · Escuela de Finanzas, Economía y Gobierno

Fecha de publicación

25 de mayo de 2026

La pregunta de augmentación

¿Detecté los errores que el copiloto introdujo en el código?

Modo AIAS: 5 — Full AI · Sesión: S06 · Duración: 100 min · Producto: 2 versiones de código + diff + audit log.

Contexto

Ludwig, Mullainathan & Rambachan (2025) (Ludwig et al., 2025) documentan que outputs de LLM como datos en regresiones introducen un nuevo tipo de error. Roth et al. (2023) (Roth et al., 2023) muestran que TWFE clásico está roto con tratamiento escalonado y los estimadores modernos (CS, CDH, BJS) requieren validación cuidadosa.

Este lab te entrena a codificar con Copilot sin que Copilot codifique por ti. La meta es producir 2 versiones (humana + asistida) y detectar dónde la IA introdujo errores.

Objetivos

  1. Replicar un fragmento de código de (Roth et al., 2023) (event-study con CS) en R o Python.
  2. Producir 2 versiones: humana (sin Copilot) y asistida (con Copilot).
  3. Comparar via diff y validar línea por línea.
  4. Detectar al menos 1 error introducido por Copilot.

Procedimiento

Paso 1 — Setup (15 min)

Carga el dataset proporcionado en 07-data/lab04/ (subset de tu propia tesis si aplica, o uno público como [LaPorta et al. 1999 — financial development]).

library(tidyverse)
library(did)        # Callaway-Sant'Anna
library(fixest)     # TWFE clásico
library(bacondecomp) # Goodman-Bacon
data <- read_csv("data/lab04/dataset.csv")
glimpse(data)

Paso 2 — Versión humana (30 min)

Sin asistencia de IA, escribe código que:

  1. Computa Goodman-Bacon decomposition.
  2. Reporta % de pesos negativos.
  3. Si % > 5%, abandona TWFE y corre Callaway-Sant’Anna.
  4. Reporta ATT(g,t) agregado dinámicamente.
  5. Genera event-study plot.

Guarda en lab04-humano.R.

Paso 3 — Versión asistida (30 min)

Borra lab04-humano.R mentalmente (no lo mires). Abre un editor con Copilot activado.

Pídele a Copilot que escriba el mismo análisis. Acepta sus sugerencias sin pensar en una primera pasada (esto es deliberado — para detectar errores después).

Guarda en lab04-copilot.R.

Paso 4 — Diff y validación (25 min)

diff lab04-humano.R lab04-copilot.R > diff.txt

Para cada diferencia, evalúa:

Diferencia Categoría ¿Error?
Sintaxis distinta, mismo resultado Estilo No
Función distinta, mismo resultado Estilo No
Parámetro por default cambiado Sustantivo Posible — investigar
Lógica distinta, distinto resultado ERROR Sí — documentar

Corre ambas versiones y compara outputs. ¿Coinciden los coeficientes? ¿Los errores estándar?

Paso 5 — Audit log (10 min)

En el audit-template.md documenta:

  • Errores detectados en versión Copilot (≥1 obligatorio).
  • Razón del error (paquete obsoleto, parámetro mal entendido, etc.).
  • Si Copilot te aumentó (escribiste mejor código que solo) o te reemplazó (aceptaste código erróneo sin pensar).

Audit log obligatorio

Llena el audit-template.md. Mínimo 1 error de Copilot detectado o justificación robusta.

Regla de aprobación

✅ Lab aprobado si: - Versión humana corre y produce output válido. - Versión Copilot corre y produce output (puede tener errores). - Diff documentado. - ≥1 error detectado en versión Copilot O justificación de por qué no se encontró. - Audit log completo.

Conexión con H3

Este lab es parte de H3 (PAP moderado + Lab-4). La rúbrica de H3 evalúa explícitamente si detectaste errores de Copilot.

Recursos

Volver arriba

Referencias

Callaway, B., & Sant’Anna, P. H. C. (2021). Difference-in-Differences with Multiple Time Periods. Journal of Econometrics, 225(2), 200-230. https://doi.org/10.1016/j.jeconom.2020.12.001
Goodman-Bacon, A. (2021). Difference-in-Differences with Variation in Treatment Timing. Journal of Econometrics, 225(2), 254-277. https://doi.org/10.1016/j.jeconom.2021.03.014
Ludwig, J., Mullainathan, S., & Rambachan, A. (2025). Large Language Models: An Applied Econometric Framework (NBER Working Paper 33344). National Bureau of Economic Research. https://doi.org/10.3386/w33344
Roth, J., Sant’Anna, P. H. C., Bilinski, A., & Poe, J. (2023). What’s Trending in Difference-in-Differences? A Synthesis of the Recent Econometrics Literature. Journal of Econometrics, 235(2), 2218-2244. https://doi.org/10.1016/j.jeconom.2023.03.008