Ética y comunicación de la ciencia en la era IA²

Cierre del curso · Sprint 0 + 3 Sprints + 🏁 H4 (35%) + Peer (10%) · Defensa AIAS 1

Juan Carlos Muñoz-Mora, PhD

Universidad EAFIT · Escuela de Finanzas, Economía y Gobierno

21 de mayo de 2026

Bienvenidos

Unidad 7 — Ética y comunicación de la ciencia en la era IA²

S07 · Jueves 21/05 · 3h online (preparación) + S08 · S08 · día por confirmar · 4h online (🏁 defensa)

Nota

Pregunta guía: Cuando defienda mi propuesta, ¿podré sostener — frente al jurado — que es mi propuesta, honesta sobre el rol de la IA, y comunicable a tres audiencias distintas?

Cierre del curso:

  • H1+H2 ✅ entregados · H3 en construcción · entrega viernes 22/05 · 23:59
  • Hoy S07: preparación · ética · video poster · socializar L5
  • S08: 🏁 H4 (35%) + Peer (10%) · Defensa AIAS 1 · cero IA al frente

Cómo trabajamos hoy — Sprint 0 + 3 Sprints

Hora Min Sprint Foco JC·Act
18:00 15 Sprint 0 · 🎤 Standup estado del PAP (en construcción) · estado del video poster · 3 voluntarios reportan 5·10
18:15 60 Sprint 1 · 📢 ¿Por qué comunicar? + comunicación de la ciencia · hook 3 jurados · pirámide · viz · SUCCES · AEA 30·30
19:15 10 ☕ Break
19:25 60 Sprint 2 · ⚖️ Ética IA² en investigación · ICMJE / Nature / COPE · autoría · AIAS · declaración firmada 40·20
20:25 35 Sprint 3 · 🤖 Socializar L5 (asincrónico) · video poster Quarto v1 · peer-assignment 10·25
TBD async 🏁 S08 asincrónico Video poster + repo H4 entregado · peer review · cierre ritual manifiesto (todo asincrónico · día por confirmar) —

Advertencia

Importante: El Lab L5 ya está hecho (asincrónico · domingo/lunes · 90 min · commiteado al repo). En Sprint 3 sólo socializamos 3 hallazgos voluntarios — no hay tiempo en clase para auditoría meta seria.

🎬 H4 = Video Poster · defensa virtual · el eje del cierre

El cambio de formato 2026:

El entregable central del curso NO es un póster A1 impreso. Es un VIDEO POSTER · entrega asincrónica · Q&A escrito asíncrono en repo.

Anatomía del video poster (3–5 min):

  • 🎯 30 seg · Hook + contribución (1 frase ≤ 12 palabras).
  • 📊 2 min · Hallazgo principal con el gráfico dominante + magnitud específica.
  • ⚙️ 1 min · Método (DAG → estrategia → método primario + cross-check).
  • 🌍 1 min · Implicación (qué cambia · para quién · próximo paso).
  • 📋 30 seg · Limitación + AI Use Disclosure visible en pantalla.

→ Subido a YouTube / Vimeo (unlisted) antes del deadline (día por confirmar). La “defensa” = el video poster + Q&A asincrónico en audit/respuestas-defensa.md del repo · respondés a las preguntas del peer + del JC sin presión de tiempo real.

Consejo

Por qué video poster · no póster A1:

  • 🎬 Defensa virtual · el A1 impreso no se ve por Zoom.
  • 🔁 Reusabilidad · el video vive en SSRN, repo, LinkedIn por años.
  • 🧠 Forzás destilación · 3 min obliga a quitar todo lo que no es la contribución.
  • 🎙️ Voz tuya · el video es la prueba pública de que defendés tu argumento.

→ Es el artefacto que va a tu portafolio profesional.

Advertencia

Lo que el video poster contiene · y lo que NO:

  • ✅ Slides Quarto renderizadas en revealjs · grabás screencast con voz.
  • ✅ Animaciones simples · transiciones limpias.
  • ❌ No es TikTok (no edición frenética).
  • ❌ No es talking-head 5 min (slides son centrales).
  • ❌ No es PowerPoint sin voz (la narración es obligatoria).

Todo lo que viene en este Sprint 1 y Sprint 3 · está orientado a tu video poster. Pirámide, viz, SUCCES, AEA, fronteras IA — son herramientas para que ese video sea defendible.

El bridge · de H1 a H4 · todo el curso en una línea

El recorrido completo:

  1. H1 (15%) ✅ entregado · Brief v2 · pregunta investigable
  2. H2 (20%) ✅ entregado · DAG + hipótesis + marco teórico
  3. H3 (20%) 🚧 en construcción · PAP moderado + Lab L4 + Replication Court · entrega vie 22/05 · 23:59
  4. H4 (35%) + Peer (10%) — HOY se prepara · DÍA POR CONFIRMAR se defiende

Tenés 35% asegurado (H1+H2). H3 está vivo en paralelo · 45% se juega entre hoy y la defensa. Hoy NO inventamos contenido nuevo — destilamos, declaramos, comunicamos.

Advertencia

Lo nuevo de U7:

  • Ética IA² como capa explícita
  • Comunicación a 3 audiencias
  • Lab L5 · ¿Quién decidió?
  • Defensa AIAS 1 · sin IA al frente

→ El día de la defensa se mide si la propuesta es tuya o de la IA.

Sprint 0 · 🎤 Standup estado del PAP + video poster

15 minutos · check de avance · H3 en construcción · estado del video poster

📍 Estructura del Sprint 0 (15 min)

0–5’ JC · ¿dónde estamos? · H3 vivo + H4 en arranque
5–13’ Act · 3 voluntarios reportan estado del PAP + video poster + qué temen del Q&A
13–15’ JC · qué se evalúa hoy + AIAS 1 (defensa)

15:00

El standup acá NO es ceremonia. Es el checkpoint con H3 todavía vivo (entrega vie 22/05 · 23:59) y el H4 empezando. El video poster se construye sobre un PAP que sigue moviéndose — esa tensión es lo que se gestiona en estos 15 min.

🎤 Reporte rápido · 3 voluntarios (5 min)

— pulsá para sortear 3 voluntarios —

Formato (90 segundos cada uno):

  1. Estado del PAP H3 — ¿qué % terminado? · ¿qué bloqueo concreto antes del viernes 22/05 23:59?
  2. Estado del video poster H4 — 0% / 30% / 60% · ¿el hallazgo dominante ya es claro?
  3. Lo que temés del QQ&A de la defensaA de la defensa — la pregunta que esperás que NO te hagan.

Consejo

La tercera pregunta es la importante. Lo que temés es justo lo que el peer reviewer va a preguntar — mejor anticiparlo hoy que defenderse en la defensa.

Sprint 1 · 📢 ¿Por qué comunicar? + comunicación de la ciencia

60 minutos · hook · 4 audiencias · viz como argumento · SUCCES · AEA Data Editor

🎣 La paradoja del investigador · ¿para quién estás escribiendo?

El silencio que se ignora
  • 32% de los papers en economía no recibe ninguna cita en sus primeros 5 años (Hamermesh 2018 · JEL).
  • El paper top-1% en JEL es leído por miles. El paper promedio es leído por ~4 personas: el autor, dos revisores, y un editor.
  • Una buena nota de política bien hecha llega a 7-12 decisores con poder real. Un paper técnico mal comunicado, a cero.

El cálculo que duele:

Pasaste 6 meses construyendo identificación causal robusta · escribiendo el PAP · auditando el Lab L4. El día de la defensa tenés 8 minutos para defenderla. Si en esos 8 minutos no comunicás, los 6 meses NO existen en la mente del jurado.

Advertencia

La pregunta que falta:

¿Tu tesis MAE va a quedarse en ese 32% mudo · o va a romper la estadística?

El método responde a tu DAG. La comunicación responde a tu lector.

Hoy aprendés a hablarle.

Consejo

El ROI de la comunicación:

  • 6 meses de análisis → audiencia natural ≈ 4 personas.
  • 4 horas de pulido comunicativo → audiencia escalada × 100, × 1000, × 10.000.

El costo más bajo · el ROI más alto de toda tu agenda de tesis vive en este sprint.

🎯 Tu propuesta va a ser juzgada por 3 jurados · ¿optimizás para todos?

① Jurado técnico día por confirmar · 12 min
  • Conoce econometría · va a romper tu identificación
  • Q&A adversarial
  • Mide: rigor · DAG · cross-checks · honestidad
Optimizás para esto desde U5.
② Empleador / RA 6 meses · 30 segundos
  • Lee tu LinkedIn · scanea tu repo GitHub
  • Necesita ENTENDER en 1 párrafo qué hiciste
  • Mide: claridad · relevancia · autonomía técnica
Optimizás esto en el README + abstract.
③ Decisor de política 2 años · 2 páginas
  • Banrep · DNP · ANIF · alcaldía · ONG
  • Lee el policy brief 2pp · cita en informes oficiales
  • Mide: implicación accionable · costo de oportunidad
Optimizás esto en el brief 2pp.

El insight central: la mayoría de tesis MAE optimiza obsesivamente para el jurado técnico (rigor) — y abandona los otros dos. Pero el impacto real de tu carrera depende de los jurados 2 y 3. La buena noticia: es el mismo argumento, traducido tres veces. Hoy aprendés a hacer esas traducciones — sin perder rigor ni inventar lo que no demostraste.

::: {.fragment .center .smaller style=“margin-top:.6rem;background:#003D2C;color:#fff;padding:.6rem;border-radius:8px”> Este sprint es el que escala tu trabajo de 4 a 4.000 lectores. No es opcional · es donde se decide si tu agenda de tesis es un soliloquio o una conversación. :::

🎓 JC 1/6 · La pirámide de difusión · 4 audiencias, un argumento

1. Paper técnico (revisor · 8,000 palabras)“¿La identificación es robusta? ¿Las robustness checks cierran? ¿Cumple AEA Data Editor?”
2. Working paper / SSRN (par académico · 30 páginas)“¿Vale la pena descargarlo y citarlo en mi propia investigación?”
3. Policy brief (decisor · 2 páginas)“¿Qué cambia en mi política pública? ¿Cuál es la implicación accionable?” (Young & Mendizabal, 2009)
4. Póster + tweet (ciudadano · 30s · 280 caracteres)“¿Por qué debería importarme? ¿Qué frase recuerdo de tu trabajo?”

Lo que se conserva en las 4 traducciones:

  1. La pregunta — siempre identificable.
  2. La contribución — qué cambia respecto del state of the art.
  3. La limitación honesta — qué no sabés.

Lo que se transforma:

  1. Jerga técnica — desaparece progresivamente.
  2. Profundidad metodológica — se condensa en una frase.
  3. Llamado a la acción — se gana en audiencia 3 y 4, no antes.

→ Si no podés hacer las 4 traducciones, no entendiste tu propio argumento.

🎓 JC 2/6 · Visualización es ARGUMENTO, no decoración

La pregunta-control antes de cada gráfico:

¿Qué COMPARACIÓN quiero que el lector haga en este gráfico — en menos de 5 segundos?

✅ SÍ (Schwabish + Wilke): - 1 comparación clara por gráfico - ≤7 colores · paleta perceptual - Anotación directa > leyenda lateral - Eje Y comienza en 0 (excepto líneas temporales) - Small multiples para tiempo × categoría - Caption que dice qué mirar

❌ NO (pecados capitales): - 📊 Bar chart 3D — distorsiona magnitud - 🥧 Pie >7 slices — el ojo no compara ángulos - 📈 Doble eje Y mal alineado — engaña - 🌈 Arcoíris categórico — orden falso - 🔢 >7 colores — caos - 🪞 Eje Y truncado para “magnificar” efecto

(Schwabish, 2021) cataloga 80+ gráficos con cuándo SÍ / cuándo NO. (Wilke, 2019) (libre · clauswilke.com/dataviz) da los principios. Tu gráfico dominante del video poster (el del hallazgo principal) tiene que pasar la prueba de los 5 segundos: si un par lo mira y NO puede decirte qué comparación muestra, rehacelo.

🎓 JC 2/6 · cont. · Prompts ready + recursos para mejorar tus gráficos

3 prompts ready · copia, pega, audita. Plantilla completa en materiales/prompts-viz.md.

Consejo

🪞 Prompt 1 · Crítica de gráfico (AIAS 3 · edición)

Critica este código ggplot en 3 ejes:
(1) ¿Cuál es la COMPARACIÓN que el gráfico hace?
    Si no es clara en 5s, márcalo.
(2) ¿Qué junk visual elimino (gridlines extras,
    leyendas redundantes, decoraciones)?
(3) ¿Cómo paso a anotación directa (geom_text)
    en lugar de leyenda lateral?

Reglas duras: NO cambies el TIPO de gráfico
(eso es decisión mía) · NO 3D · NO doble eje Y
· NO arcoíris categórico.

[pegar tu código aquí]

Consejo

🛠 Prompt 2 · Refinamiento event-study (AIAS 4 · pair coding)

Genera ggplot mínimo de event-study staggered:
- Eje X: tiempo relativo (-5 a +5)
- Eje Y: ATT con CI95 (geom_pointrange)
- Vline en t=0 · Hline en y=0
- Anotación directa del ATT en t=1
- Paleta perceptual (Wilke style)
- Caption con N · método (CS o CDH) · DOI

Datos placeholder. Voy a auditar línea por línea.

Consejo

🌎 Prompt 3 · Traducción multi-audiencia (AIAS 3)

Tengo este gráfico [pegar descripción].
Generá 3 títulos para 3 audiencias:
(1) Revisor técnico (preciso · con método)
(2) Decisor política (Banrep/DNP · accionable)
(3) Ciudadano (1 frase · sin jerga)

Conservá la MAGNITUD exacta (no inflar, no diluir).
Conservá los QUALIFIERS metodológicos.

Nota

📚 Recursos web · curados para MAE

Recurso Para qué
clauswilke.com/dataviz Wilke libro completo · libre · principios
policyviz.com Schwabish blog · podcast · plantillas
storytellingwithdata.com Cole Knaflic · narrativa visual
flowingdata.com Nathan Yau · catálogo de tipos
datawrapper.de Low-code · ideal policy brief
r-graph-gallery.com Catálogo ggplot copy-paste
from-data-to-viz.com Decisión: ¿qué gráfico uso?
coolors.co · viz-palette.com Paletas perceptuales · daltonismo
evergreendata.com Evergreen · viz para no-académicos

Advertencia

Cómo usarlos en orden:

  1. Decidí la comparación (vos, no la IA · ver fragment ✅).
  2. Buscá el tipo en data-to-viz o r-graph-gallery.
  3. Pedile a la IA el ggplot con Prompt 2.
  4. Auditá con Prompt 1.
  5. Traducí títulos con Prompt 3.
  6. Verificá paleta en viz-palette (daltonismo).

→ El gráfico dominante del video poster recorre los 6 pasos · es el visual central del video.

Recordatorio del JC 4/6 que viene: estos prompts mejoran la forma. NO te eximen de auditar el contenido (números, qualifiers, paleta perceptual). La IA puede hacerte un gráfico bello con datos inventados — y se nota.

🎓 JC 3/6 · Framework SUCCES de Heath & Heath

SSimple
1 idea core
UUnexpected
romper expectativa
CConcrete
números, ejemplos
CCredible
cita, audit, repo
EEmotional
¿a quién importa?
SStory
3 actos · arco

(Heath & Heath, 2007) — Made to Stick · 6 atributos de las ideas que sobreviven.

Aplicado al video poster:

Atributo Cómo verlo en tu video poster
Simple El título dice la contribución en 1 frase ≤12 palabras
Unexpected El hallazgo rompe una expectativa de la literatura previa
Concrete Magnitud específica del efecto (no “significativo”: 1.7 pp ± 0.4)
Credible QR al repo + DOI Zenodo + audit logs · L1–L5 verificables
Emotional El gráfico dominante muestra a quién impacta (heterogeneidad por subgrupo)
Story 3 actos visibles: setup (pregunta) · confrontación (método) · resolución (hallazgo)

→ El par académico que mire 30 segundos debe poder repetir tu argumento. Si no, fallaste en alguna de las 6 dimensiones.

🎓 JC 4/6 · 🤖 IA en escritura · el espejismo del igualador (5 min)

El hallazgo cuantitativo:

  • 10% de abstracts en 2024 fueron asistidos por LLM (hasta 30% en PubMed) (Kobak et al., 2024).
  • Las palabras-marca explotaron post-ChatGPT: delve · intricate · underscore · multifaceted · realm · commendable · meticulous. Si tu abstract usa ≥3, suena a IA.
  • (Liang et al., 2025) confirma adopción exponencial post-2023.

La paradoja del “igualador lingüístico”:

  • ✅ ChatGPT cierra brechas léxicas para no-anglófonos (Geng & Trotta, 2025) — ventaja en complejidad léxica medible.
  • ❌ Pero los autores no-anglófonos pierden 0.18 SD de novedad relativa (~7 percentiles) al adoptar LLMs (Cornell 2025, arXiv 2603.22510) — la IA empuja a pensamiento convencional.

Advertencia

Lo que la IA gana · y lo que cuesta:

Dimensión Con IA Sin IA
Forma · fluidez ✅ ↑ ↓
Vocabulario · variedad ✅ ↑ medio
Voz distintiva ❌ ↓ ✅ ↑
Novedad conceptual ❌ ↓ ✅ ↑
Riesgo de “AI tells” ❌ alto —

→ Para MAE LATAM: forma sí, ideas no. La IA pule tu español académico · pero no debe generar tu argumento.

Consejo

Test mental antes de cerrar el abstract: ¿uso delve, intricate, underscore, multifaceted más de una vez? Si sí, reescribí esa frase con tu voz.

Regla operativa H4: la IA edita · vos escribís el primer borrador. Si el primer borrador lo escribió la IA, la voz que defendés en la defensa no es tuya — y se nota.

🎓 JC 5/6 · 🪞 IA en traducción · generalization bias + sesgo LATAM (5 min)

El problema documentado (Peters & Chin-Yee, 2025) (Royal Society Open Sci):

Analizaron 4,900 resúmenes LLM vs originales. Cifras pivote:

  • DeepSeek, GPT-4o, LLaMA 3.3 sobregeneralizan en 26-73% de casos — incluso con prompts que piden precisión.
  • LLM summaries son 5× más propensos a generalizaciones amplias que humanos.
  • Modelos nuevos > viejos en este vicio — GPT-4o peor que GPT-3.5.

Lo que se pierde típicamente:

  • Qualifiers metodológicos (“in this sample”, “under assumption X”, “may suggest”)
  • Condicionalidad (“in low-income contexts”)
  • Limitaciones explícitas

→ Tu policy brief de 2pp puede invertir el signo de la contribución sin que lo notes.

Advertencia

El sesgo LATAM · doble penalidad:

  • LLMs globales: 2-3% del corpus es español/portugués (Latam-GPT 2025 · CENIA).
  • Variantes peninsulares dominan sobre LATAM (arXiv 2602.09346).
  • Instituciones LATAM sub-representadas: el LLM puede no reconocer CONEVAL, DANE, MIDIS, DNP, Banrep.
  • Benchmarks EsBBQ / CaBBQ (arXiv 2507.11216): LLMs reproducen estereotipos socio-económicos LATAM.

→ Para tu policy brief Banrep/DNP/Comfama: revisá institución por institución lo que la IA escribió.

Consejo

3 reglas para el brief 2pp asistido por IA:

  1. Verbatim qualifiers del paper original · no parafrasear “may” como “does”.
  2. Temperature baja · no creatividad inventada.
  3. Revisión manual de toda mención institucional LATAM.

Regla brutal: si traducís tu paper a policy brief con IA y NO le hacés el chequeo de qualifiers, estás escribiendo un brief que el paper no respalda. Eso es deshonestidad metodológica, no solo “mala edición”.

🎓 JC 6/6 · AEA Data Editor · reproducibilidad como gate (5 min)

El cambio institucional 2020+:

Desde 2020, la AEA (American Economic Association) instituyó al Data Editor como gate de publicación para todas sus revistas (AER, AEJ, JEL). El equipo de Lars Vilhuber verifica reproducibilidad de cada paper aceptado antes de que llegue al journal.

Lo que documenta (Vilhuber, 2020):

  • ~40% de papers AER requieren correcciones de replicabilidad en revisión.
  • Causas típicas: paths absolutos · datos no disponibles · librerías sin versión · seeds no fijadas · README ausente.
  • Sin reproducibilidad confirmada · no hay DOI · no hay publicación.

→ Esto NO es opcional. Es el estándar emergente global — replicado por Restud, JoE, AEJ, J Public Econ, próximamente Econometrica.

Advertencia

Qué exige el AEA Data Editor (y tu H4 también):

  1. Código que corre en otro computador sin intervención manual.
  2. README claro con instrucciones de replicación.
  3. Datos disponibles (o explicación clara de por qué no, con instrucciones para obtenerlos).
  4. sessionInfo() / requirements.txt / renv.lock archivado.
  5. Outputs (tablas + figuras) reproducibles desde código + datos.
  6. Seeds fijadas en todo paso estocástico.

Consejo

Tu H4 ya está montado para esto: la estructura de proyecto IA² de U6 Sprint 0 (carpetas + CLAUDE.md + Makefile + audit logs) es exactamente el formato AEA Data Editor. Si seguiste U6, tu repo ya pasa el filtro.

Regla operativa del H4: antes de la defensa, corré make all (o equivalente) en una máquina virgen o pediéndole a un compañero/a. Si falla, falla la entrega. El revisor real (defensa) hace exactamente eso.

🛠 Actividad (5 min) · gráfico dominante del video poster

Cada estudiante define HOY (en papel o tableta):

  1. ¿Cuál es el hallazgo principal? (1 frase ≤20 palabras)
  2. ¿Qué comparación lo muestra? (X vs Y · tratado vs control · pre vs post · etc.)
  3. ¿Qué tipo de gráfico hace esa comparación obvia? (consulta Schwabish/Wilke)
  4. ¿Quién es la audiencia núcleo del gráfico? (revisor, decisor, ciudadano)
  5. Prueba de 5 segundos: se lo mostrás al de al lado · ¿puede decirte qué comparación muestra?

Consejo

Workflow IA² recomendado (Modo AIAS 3 · Edición):

  1. Vos decidís la comparación clave y el tipo de gráfico (NO se delega).
  2. IA implementa el código base ggplot/plotly/seaborn.
  3. Vos auditás que el código corra y que el output diga lo que prometiste.
  4. IA critica: “¿hay junk visual? ¿es clara la comparación? ¿mejora con anotación directa?”
  5. Vos editás el output final. La IA NO es la autora del argumento visual.

Sprint 2 · ⚖️ Ética en investigación · estructural + IA²

60 minutos · 2 bloques · ética que ya existía (fraude · p-hacking · replicabilidad) + ética que la IA agrega (autoría · ilusiones · declaración)

📍 Estructura del Sprint 2 · 2 bloques + actividad

0–25’ 🏛️ Bloque A · Ética estructural · 3 JC (Stapel · Ioannidis · Open Science)
25–50’ 🤖 Bloque B · Ética IA² · 3 JC (Convergencia 2023 · Messeri-Crockett · AIAS)
50–60’ 🛠 Actividad · declaración AI Use (10 min)

60:00

El puente desde Sprint 1: comunicaste bien las 3 traducciones — paper, brief, video poster. Ahora la pregunta ética: ¿bajo qué firma sale esa comunicación? Sprint 1 te enseñó a escalar tu trabajo · Sprint 2 te enseña a declararlo con honestidad.

Por qué 2 bloques · no uno solo. La ética en investigación no nació con ChatGPT. Hay dilemas estructurales (fraude, p-hacking, replicabilidad) que llevan décadas y que la IA NO inventa pero sí amplifica. Empezamos por ahí — para que la IA aterrice en un suelo ético que ya tenía sus propias grietas.

🏛️ Bloque A · Ética estructural · lo que ya existía antes de la IA

25 minutos · 3 JC · casos · diagnóstico · soluciones

🎓 JC A1/3 · 4 fraudes que cambiaron la conversación · introducción (1 min)

Antes de ChatGPT existió esto. Cuatro casos · cuatro disciplinas · cuatro décadas distintas · el mismo patrón estructural: opacidad + presión por publicar + caja negra de los datos. Los siguientes 4 slides son los detonantes del estándar moderno (PAP · Open Data · replicación · AEA Data Editor) que recorrimos en U3-U6.

Consejo

“Sin los datos no eres más que otra persona con una opinión.” — W. Edwards Deming

① Stapel Tilburg · 2011
Psicología social
58 retractaciones
② Wansink Cornell · 2017-18
Marketing / nutrición
18 retractaciones
③ LaCour UCLA · 2015
Ciencia política
Science retractado
④ Reinhart-Rogoff Harvard · 2010
Macroeconomía
Política mundial

Una pregunta para cada caso: ¿cómo pudo pasar esto · y qué nos dejó en herramientas para que no se repita?

🎓 ① Diederik Stapel · Tilburg · 2011 · psicología social

Diederik Stapel · ex-profesor Tilburg University

Diederik Stapel · Tilburg University · decano School of Social Sciences

El profesor estrella:

  • Decano de la School of Social Sciences en Tilburg.
  • ~150 publicaciones en Science, Psych Science, JPSP · múltiples premios.
  • Dirigió 20+ tesis doctorales. Curiosamente, nunca compartió la data cruda con coautores ni estudiantes.

El modus operandi (descubierto en 2011):

  • Stapel diseñaba el experimento con sus estudiantes.
  • Decía: “ya tengo contactos en escuelas · yo lo corro” (había sido profesor de colegio).
  • Volvía con una hoja Excel con datos ficticios.
  • Los grad students hacían el análisis, creyendo que era real.

La confesión (Levelt Report · nov 2011):

“I failed as a scientist. I adapted research data and fabricated research. Not once, but several times, not for a short period, but over a longer period of time.”

Consecuencia: despedido · PhD devuelto · investigación criminal · 58 papers retractados · 30+ tesis doctorales quedaron contaminadas. Stapel escribió su confesión en el libro “Ontsporing” (Descarrilamiento, 2012).

Estudio famoso fabricado: “basura en el suelo aumenta el prejuicio racial” — citado en Science 2011, retractado. Lección estructural: la cadena de confianza (PI → grad student → reviewer) falla cuando NO hay data cruda compartida. Open Data nace de Stapel.

🎓 ② Brian Wansink · Cornell · 2017-2018 · “Mindless Eating”

Brian Wansink · ex-director Cornell Food and Brand Lab

Brian Wansink · Cornell Food & Brand Lab · autor de “Mindless Eating”

El gurú de la alimentación:

  • Director del Cornell Food and Brand Lab (financiado por USDA).
  • Autor del bestseller “Mindless Eating” (1M+ copias).
  • Sus estudios sobre diseño de cafeterías escolares se convirtieron en política pública en USA.
  • Citado en TED talks, Oprah, NYT.

El detonante (Nov 2016 · blog post propio):

“Hilarie was a remarkable visiting scholar from Turkey for 6 months who had no good results yet. I refused to settle for that. I asked her to slice up the data into different categories and run new analyses…”

Lo que se documentó después (BuzzFeed News + retractadores · 2017-2018):

  • p-hacking sistemático · cherry-picking · HARKing (Hypothesizing After Results are Known).
  • Misreporting de estadísticas (n’s distintos en el mismo paper · grados de libertad imposibles).
  • 150 errores estadísticos detectados en 4 papers solamente.
  • Documentación deficiente · autoría inapropiada.

Consecuencia: 18 retractaciones · 15 correcciones · renuncia forzada (septiembre 2018) · Cornell prohíbe nuevas docencias.

Lección estructural: el enemigo NO siempre es fabricar datos · a veces es explorar hasta encontrar lo que buscás. Wansink hizo lo que muchos hacen — pero lo dijo en voz alta. Esto detonó el movimiento de pre-registro y researcher degrees of freedom ((Simmons et al., 2011)).

🎓 ③ Michael LaCour · UCLA → Princeton · 2014-2015 · ciencia política

Michael LaCour y portada del paper Science 2014

LaCour & Green 2014 · Science 346:1366 · retractado mayo 2015

El paper estelar:

  • Science 2014 · “When contact changes minds” — co-autor Donald Green (Columbia, no implicado).
  • Hallazgo: una conversación de 20 min con un canvasser gay cambiaba opiniones sobre matrimonio igualitario · efecto duradero a 9 meses.
  • Cobertura mediática masiva (This American Life, NYT, WaPo).
  • Princeton ofrece tenure-track antes de la retractación.

Quién lo descubrió: 2 grad students de Berkeley

  • David Broockman + Joshua Kalla quisieron replicar el experimento.
  • Pidieron IRB approval; LaCour les dio el nombre de una survey company falsa.
  • Cuando contactaron a la “empresa”, no existía.
  • Reconstruyeron desde cero · publicaron “Irregularities in LaCour (2014)” en mayo 2015.

El fraude técnico:

  • LaCour usó datos del Cooperative Campaign Analysis Project (CCAP).
  • Inventó respuestas con simulación · pero los patrones eran demasiado limpios (CI estrechos imposibles para n=72).

Consecuencia: retractación 28-may-2015 · Princeton retira la oferta · carrera académica terminada.

Lección estructural: la replicación científica (Hamermesh 2007 · distinta data, mismo método) es la única defensa real contra fraude sutil. Broockman-Kalla detectaron lo que ningún reviewer pudo. Esto detonó el AEA RCT Registry y los protocolos de pre-registro modernos.

🎓 ④ Reinhart & Rogoff · Harvard · 2010 · “Growth in a Time of Debt”

El error de Excel en Reinhart-Rogoff 2010 · celdas omitidas en el promedio

El infame error: filas omitidas del AVERAGE() · Australia, Austria, Bélgica, Canadá, Dinamarca

El paper más citado en política fiscal de 2010-2013:

  • NBER Working Paper 15639 · Reinhart & Rogoff 2010.
  • Hallazgo: debt/GDP > 90% → caída drástica del crecimiento (~−0.1% promedio).
  • Citado por: Paul Ryan, Olli Rehn (ECB), George Osborne (UK), FMI — base de la austeridad post-2008.
  • Sin acceso público a los datos durante 3 años.

Quién lo descubrió: un PhD student de UMass Amherst

  • Thomas Herndon intentó replicarlo en una tarea de curso (2013).
  • No podía. Pidió la hoja Excel original a Reinhart.
  • Encontró 3 problemas:
    1. Error de Excel: el AVERAGE() no incluía 5 países (selección de rango parcial).
    2. Weighting cuestionable: New Zealand 1951 (un año, −7.6%) pesaba igual que UK 1946-1964 (19 años).
    3. Cherry-picking de períodos.

El resultado real:

  • Países con debt > 90% tienen crecimiento −0.1% → en realidad +2.2% (corregido).
  • Sigue habiendo correlación negativa, pero NO el cliff dramático.

Consecuencia: Reinhart-Rogoff reconocieron el error de Excel · debate académico de meses · el argumento de la austeridad perdió fuerza empírica mundial.

Lección estructural: NO siempre es fraude — a veces es error humano que la opacidad convierte en política pública. Herndon detectó en una tarea de curso lo que el FMI usó por 3 años. Esto detonó el push por código + datos públicos antes de publicación (AEA Data Editor 2020 vive aquí).

🎓 Lo que estos 4 casos nos dejaron · síntesis (1 min)

Caso El problema estructural que reveló La herramienta moderna que nació
① Stapel PI nunca comparte data cruda · cadena de confianza opaca Open Data obligatoria (OSF · Dataverse · Zenodo · AEA Data Editor)
② Wansink Researcher degrees of freedom · p-hacking estructural Pre-registro + PAP moderado (Banerjee-Duflo · AsPredicted · AEA Registry)
③ LaCour Fraude sofisticado pasa peer review Replicación científica (Hamermesh 2007 · Broockman-Kalla protocol)
④ R&R Error humano + opacidad → política mundial errónea Código + datos públicos antes de publicación (AEA Data Editor 2020)

🎯 El punto que cierra Bloque A: la IA NO inventa estos 4 problemas — pero amplifica los 4 a la vez (Stapel × velocidad · Wansink × auto · LaCour × plausibilidad · R&R × escala). Lo que el Bloque B muestra es que las herramientas modernas siguen siendo las correctas — sólo hay que aplicarlas con disciplina renovada.

🎓 JC A2/3 · El problema técnico · Ioannidis 2005 y los grados de libertad del investigador (8 min)

Ioannidis 2005 (Ioannidis, 2005) (PLoS Medicine) demostró formalmente:

“La mayoría de los hallazgos publicados en investigación son falsos.”

El argumento depende del PPV (Positive Predictive Value):

\[PPV = \frac{(1-\beta) \cdot R}{(1-\beta) \cdot R + \alpha}\]

Donde: - \(\alpha\) = prob. Error tipo I (falso positivo, típicamente 0.05) - \(\beta\) = prob. Error tipo II (falso negativo · poder = \(1-\beta\)) - \(R\) = ratio de relaciones reales vs falsas en la literatura del área

Sesgo del investigador \(u\): cuando se agrega · \(PPV\) cae aún más. Cuanto más exploratorio el campo, más bajo \(PPV\).

Advertencia

Researcher Degrees of Freedom (Simmons et al., 2011) (Psychological Science):

“La significancia estadística puede ser fácilmente generada con un poco de manipulación de datos · muchas de ellas consideradas estándar.”

Prácticas problemáticas comunes (todas tienen nombre técnico): - 🎣 p-hacking · probar especificaciones hasta encontrar \(p<0.05\) - 🗄️ file drawer problem · no publicar nulls (Rosenthal 1979) - 📊 HARKing · Hypothesizing After Results are Known - ✂️ Cherry-picking · reportar solo controles favorables - 🧪 Outcome switching · cambiar el outcome principal post-hoc

Consejo

Diagnóstico: (Simonsohn et al., 2014) propuso la p-curve · si la distribución de p-valores se concentra justo bajo 0.05, hay p-hacking sistémico en el campo. Brodeur 2020 mostró que IV y DiD tienen el patrón más marcado en economía.

Implicación para tu tesis: el PAP moderado (H3) y el Lab L4 audit log NO son burocracia — son respuestas operativas a Ioannidis-Simmons. Cada arista de tu DAG que decidiste antes de ver los datos es un grado de libertad que cerraste.

🎓 JC A3/3 · Open Science · 3 capas de respuesta operativa (9 min)

① Pre-registro Antes de ver los datos
  • Pregunta, diseño muestral, instrumentos
  • Especificación primaria + ajustes
  • OSF · AsPredicted · AEA RCT Registry
  • PAP moderado [@BanerjeeDuflo2020] · ya hiciste H3
→ Cierra los grados de libertad antes de los resultados
② Open Data + Code Después de la publicación
  • GitHub · control de versión
  • OSF (osf.io) · datos + materiales
  • Dataverse (Harvard) · curaduría académica
  • Zenodo · DOI permanente
→ El AEA Data Editor (Sprint 1) vive aquí
③ Replicación Hamermesh 2007 · 3 tipos
  • Pura: mismo data, mismo código
  • Científica: distinta data, mismo método
  • Estadística: data extendida, mismo código
→ Las 3 son distintas. La que te pide AEA es la PURA.

Prácticas operativas que viste durante este curso:

Práctica Cuándo · dónde
Estructura de carpetas + naming convention U6 Sprint 0 · montar proyecto IA²
Comentarios densos en código · set.seed(2026) Lab L4 · regla dura
sessionInfo() / renv.lock / requirements.txt H3 entregable
Audit log markdown vivo · no chat efímero Lab L4 entregable
README claro · make all reproducible H4 entregable (AEA Data Editor)
Pre-registro PAP moderado H1 mini-PAP · H3 PAP completo

→ Si terminás U7 sin haber hecho al menos una de estas, el problema no es la IA — sos vos.

Bridge al Bloque B: ahora que viste cómo la ética estructural respondió al fraude pre-IA, podemos ver qué nuevas dimensiones agrega la IA — y por qué la respuesta NO es “más detección” sino más declaración.

🤖 Bloque B · Ética IA² · lo que la IA agrega

25 minutos · 3 JC · convergencia 2023 · ilusiones · AIAS

🎓 JC B1/3 · El momento de convergencia · enero 2023

El detonante: ChatGPT firma 4 papers en diciembre 2022 — aparecen co-authored con “ChatGPT” en preprints y un paper en Oncoscience.

Las editoriales reaccionan en cascada:

Advertencia

Lo común a las 5 posiciones: IA NO es autora · debe declararse · detección no es el camino · sesgos son problema del primer autor. La convergencia global es nítida. No es opcional para tu tesis 2026.

Editorial Nature 613:612 · 26 enero 2023 · Tools such as ChatGPT threaten transparent science: here are our ground rules for their use

Nature 613:612 · 26-ene-2023 · d41586-023-00191-1 · la editorial que abrió la cascada institucional 2023.

🎓 JC B1 · cont. · El estándar ICMJE · qué dice exactamente

ICMJE 2023Recomendaciones a editores biomédicos · adoptado por 4,000+ revistas. IA: no autora · declaración obligatoria · responsable indelegable.
Nature 2023Editorial 613:612. “No LLM tool will be accepted as a credited author.” Uso de IA documentado en Methods o Acknowledgements.
COPE 2023Committee on Publication Ethics · guidance para casos límite (parafraseo, traducción, edición de estilo). Disclosure aplica también.
WAME 2023World Association of Medical Editors · 4 recomendaciones · alineadas con ICMJE.
AEA/JEL 2024American Economic Association · AEA Data Editor + Code of Professional Conduct. IA en métodos + replicabilidad como gate de publicación.

Consejo

Lo que tu sección “AI Use Disclosure” debe contener (template):

  1. Modelos usados: ChatGPT-4 · Claude Opus · Cursor · Elicit · NotebookLM.
  2. Tareas delegadas: búsqueda bibliográfica · borrador de párrafos · revisión de código · generación de figuras.
  3. Tareas NO delegadas: pregunta de investigación · DAG · interpretación de hallazgos · conclusiones.
  4. Modo AIAS dominante por entregable: H1=AIAS 2, H2=AIAS 3, H3=AIAS 4, H4=AIAS 3.
  5. Audit logs disponibles en repo: audit/L1-thread.md · audit/L4-pair-programming.md · audit/L5-meta.md.

→ Sin esta sección, no hay nota. Modelo de ICMJE adaptado a economía está en materiales/declaracion-uso-ia.md.

🎓 JC B2/3 · Las 4 ilusiones de Messeri-Crockett

(Messeri & Crockett, 2024) (Nature) — el argumento epistémico detrás de toda la convergencia ética:

1. ProfundidadEl resumen reemplaza la lectura. Sentís que entendiste el paper porque la IA lo resumió bien.
2. ObjetividadEl output suena neutro pero hereda sesgos sistemáticos del corpus de entrenamiento.
3. AmplitudParece cubrir literatura que NO leíste. La revisión de la IA no es tu revisión.
4. ComprensiónExplicar el concepto a la IA reemplaza explicártelo a vos. Sentís claridad sin tenerla.

Pregunta-control para defensa (día por confirmar):

Si el jurado te pregunta “¿qué dice Cinelli 2024 sobre good controls?” — ¿podés responder sin haber leído el paper completo, o estás operando sobre la ilusión de profundidad?

→ Las 4 ilusiones son la razón ética por la que AIAS y la declaración existen. No es burocracia editorial: es honestidad epistémica sobre qué ilusiones operaron en cada paso.

🎓 JC B3/3 · AIAS como ética operativa

AIAS 1No AI · DEFENSA + PEER REVIEW
AIAS 2Planning · ideación · S07 hoy
AIAS 3Refinement · edición · L5
AIAS 4Full Support · Lab L4 (durante el curso)
AIAS 5AI Exploration · creación libre

Por qué AIAS funciona donde la detección falla:

  • (Perkins, Roe, et al., 2024): software de detección tiene >30% error rate. Falsos positivos para escritura no-nativa. Falsos negativos para texto IA editado.
  • AIAS invierte la lógica: no perseguimos · declaramos. La nota no se gana por usar poco IA — se gana por declararlo honestamente.
  • (Perkins, Furze, et al., 2024): el modo no es “permiso” — es mapa cognitivo del estudiante.

Advertencia

Reglas duras del curso:

  1. Cada entregable declara su modo AIAS dominante.
  2. Modo declarado ≠ modo real = falta grave (ética, no técnica).
  3. Defensa = AIAS 1. No negociable.
  4. Peer = AIAS 1. Si el peer usó IA en su review → descalifica al peer (no al peer-reviewed).
  5. El primer autor (vos) es responsable de TODO output declarado. ICMJE no admite “fue la IA”.

🚩 JC B3 · cont. · Las nuevas fronteras de la ética IA² · prompts que no debés usar

Lo que la IA agrega a los dilemas estructurales del Bloque A: escala y plausibilidad superficial. Lo que antes requería días de manipulación deliberada, ahora se puede hacer en 30 segundos con un prompt. Estos son los 5 prompts que vas a encontrar en threads de estudiantes/colegas — y que debés reconocer · rechazar · reportar.

Patrón problemático ❌ Prompt que VULNERA ética ✅ Prompt éticamente aceptable
🎲 Fabricación de datos
Stapel 2.0 · ICMJE: "research fraud"
"Generá 500 observaciones sintéticas con una correlación de 0.6 entre X e Y, distribución normal, para que mi regresión muestre el efecto esperado." "Genera datos sintéticos para TESTING del pipeline. Etiquétalos claramente como 'fake_data_for_pipeline_test'. Documentá en audit log que estos datos NO entran al análisis final."
🎣 Specification search automatizado
p-hacking con IA · Simmons 2011 amplificado
"Probá 20 combinaciones distintas de variables de control para esta regresión. Devolveme las 3 con p < 0.05." "Mi adjustment set pre-registrado es [X1, X2, X3] basado en el DAG. Mostrame ESTOS controles + 2 placebos pre-declarados. Si encontrás algo no pre-registrado, marcalo como EXPLORATORY."
📈 Spin de resultados nulls
"Reformulate to sound positive"
"Mi efecto es null pero el coeficiente apunta en la dirección esperada. Reescribí el abstract para que suene a evidencia positiva." "Mi efecto es null (CI95 cruza 0). Ayudame a escribir el abstract reconociendo el null + discutiendo el MDE = X · qué implica · qué NO podemos descartar."
📚 Citas alucinadas
Buchanan-Hill 2024 · cita inventada
"Citá 5 papers que respalden la idea de que [X causa Y vía mecanismo Z] en LATAM." "Tengo este claim teórico. Buscame candidatos a citar y devolveme DOI verificable de cada uno. Yo verifico el DOI antes de citar. Si no encontrás → decime null."
🔍 Robustness checks de confirmación
"Confirma mi resultado"
"Generá 5 robustness checks que confirmen el efecto principal de mi paper." "Generá 5 robustness checks que ATAQUEN el efecto principal: 1 placebo, 1 con muestra alternativa, 1 con bandwidth alternativa, 1 sin outliers, 1 con cross-check Sun-Abraham. Si alguno falla → reportá."

Las 3 reglas duras que estos ejemplos enseñan:

  1. La IA NO debe orientarse al resultado deseado. Si tu prompt menciona “el efecto esperado · que confirme · que respalde · que demuestre” — estás contaminando la búsqueda. Honest workflow: prompt orientado a verdad, no a conclusión.
  2. La IA NO debe inventar evidencia que no auditás. Cada cita debe verificarse · cada dato sintético etiquetarse · cada test reportarse aunque falle. Si no podés mostrar el DOI o el código que generó el número, no entra al paper.
  3. La IA amplifica el sesgo del investigador. Researcher Degrees of Freedom (Simmons 2011) × velocidad IA = capacidad sin precedentes para p-hackear. AIAS modo declarado no es paranoia institucional · es una válvula de honestidad consigo mismo.

::: {.fragment .center .smaller style=“margin-top:.4rem;background:#B23A1A;color:#fff;padding:.5rem;border-radius:8px”> 🚩 Si reconocés alguno de estos prompts en tu propio thread del curso · marcalo en el audit L5 como [PATRÓN_PROBLEMÁTICO_DETECTADO] · reescribí el output · documentá la corrección. Eso es Sprint 3 honestamente hecho. :::

🛠 Actividad (20 min) · escribir tu Declaración AI Use

Plantilla obligatoria materiales/declaracion-uso-ia.md:

## AI Use Disclosure (estilo ICMJE 2023)

**Modelos:**
- [ChatGPT-4 / Claude Opus / Cursor / Elicit / NotebookLM ...]

**Tareas asistidas por IA:**
- [búsqueda bibliográfica · borrador de literatura · revisión de código R/Stata · ...]

**Tareas NO asistidas (autoría plena humana):**
- [pregunta de investigación · construcción del DAG · interpretación de hallazgos · ...]

**Modo AIAS dominante por entregable:**
| Hito | Modo | Justificación |
|---|---|---|
| H1 Brief | AIAS 2 | Planning. Borrador propio, IA crítica. |
| H2 DAG  | AIAS 3 | Edición. Yo dibujo, IA revisa good/bad controls. |
| H3 PAP  | AIAS 4 | Full Support. Pair programming auditado (Lab L4). |
| H4 Póster | AIAS 3 | Edición. Yo escribo, IA reescribe títulos. |

**Audit logs:** `audit/L1.md` · `audit/L4.md` · `audit/L5.md`

**Declaración:** Soy responsable única de la propuesta. La IA NO es autora. Todo output asistido fue auditado y editado por mí antes de incluirlo.

Firma: _________ · Fecha: 2026-05-23

→ Entra al repo HOY. Si no está, el viernes no hay nota.

Pregunta-control: ¿Lo que escribiste en esta declaración coincidiría con un análisis de tus prompts? Si no, reescribilo HOY — el día de la defensa el JC te lo va a preguntar en el Q&A.

Sprint 3 · 🚀 Nuevas fronteras + cierre logístico

40 minutos · 4 fronteras de la comunicación científica IA² · peer-assignment · checklist defensa

🚀 Lo que viene después del paper técnico (2 min)

Ya cubrimos lo “clásico-moderno”: pirámide de 4 audiencias · viz como argumento · SUCCES · AEA Data Editor · ética IA² declarada. Eso te lleva al estándar 2025.

Pero hay 4 fronteras emergentes 2024–2026 que ya están moviendo la frontera:

① 🤖 Chatbots del paper
Custom GPT entrenado sobre tu tesis · Elicit · scite · NotebookLM
② 🎙️ Podcast científico
NotebookLM Audio Overview · Mixtape · ResearchInBrief
③ 🧊 Fisicalización
De gráfico a objeto físico · warming stripes · dataphys
④ 🧠 Ciencias del comportamiento
EAST framework · spin auditado · framing al servicio de la comunicación

Consejo

Pregunta de exploración:

“Tu tesis MAE 2026 no sólo es un paper · es un ecosistema de comunicación que vive por años.”

Estas 4 fronteras NO son requisitos de la defensa · son el techo de lo que podrías hacer en los próximos 6 meses · 2 años · 5 años. Hoy las nombramos para que sepas dónde mirar.

Advertencia

Modo del Sprint 3: AIAS 2 (Planning). La idea NO es ejecutar las 4 fronteras hoy · es mapearlas y elegir 1 que vas a explorar en tu compromiso 3-6 meses (post-defensa).

🎓 JC 1/4 · 🤖 Chatbots para divulgación · el paper que conversa (5 min)

La adopción: 57% (2024) → 84% (2025) de investigadores usan IA generativa; 45% → 62% para tareas de investigación/publicación.

Stack lean 2026: Elicit · scite.ai · NotebookLM · Custom GPT o Claude Project entrenado sobre tu propia tesis.

Cómo se ve un “paper-chatbot”:

  • Cargás PDF del paper + dataset + código + audit logs.
  • Definís system prompt con límites explícitos: “no inventes números, cita sección del paper, declara incertidumbre”.
  • Publicás QR al chatbot en la descripción del video / overlay · cualquiera puede hacerle preguntas 24/7.

Caso documentado: Hake et al. (World Neurosurgery 2024) — Custom GPT sobre paper propio acelera Q&A pero arrastra sesgos del autor. Análisis de 140 resúmenes (Annals of Family Medicine 2024): mediana 90/100 calidad · 4 con alucinaciones graves que invierten interpretación (e.g. RCT abierto descrito como doble-ciego).

Advertencia

3 reglas para tu paper-chatbot:

  1. System prompt público · publicalo junto al QR · “AI Use” extendida.
  2. Disclaimer de alucinación visible: “Este chatbot puede inventar · verificá toda cifra contra el PDF.”
  3. Audit de spin mensual · pediile a un peer que liste 10 outputs y marque ≥1 falso.

Consejo

Acción concreta MAE post-defensa:

Claude Project "Tesis_[Apellido]_2026":
- PDF tesis · dataset · código R/Python
- DAG H2 · PAP H3 · audit logs L1-L5
- system_prompt.md · disclaimer.md
- "ASK_ME_3" prompts ready para visitantes

→ Link al chatbot en el README.md del repo · próximo nivel del AEA Data Editor.

Cita ancla: (Hake et al., 2024) · (Saasnik, 2026) · (Family Medicine, 2024). La adopción está pasando · la disciplina ética no.

🎓 JC 2/4 · 🎙️ Podcast científico · NotebookLM Audio Overviews (5 min)

La explosión 2024–2025: +2 millones de usuarios activos de NotebookLM Audio Overviews. Desde septiembre 2025 disponible en 80+ idiomas (incluido español LATAM).

Formatos: Deep Dive (15-20 min · 2 voces) · Brief (5 min) · Critique (adversarial) · Debate (pro/contra).

El podcast académico tradicional sigue creciendo:

  • The Mixtape with Scott (Cunningham · causal inference).
  • ResearchInBrief (AEA) · NBER This Week.
  • LATAM emergente: Empíricos en Latam, Estudio Diferentes.

Validación dominio-específica:

  • Flynn (AGU/Wiley 2025) evalúa Audio Overviews en ciencias planetarias: resúmenes “engaging” y “fairly accurate” — pero omiten métodos y nuance.
  • Riesgo APA 2025: el formato auditivo eleva engagement inicial pero deprime profundidad de comprensión (cognitive offloading).

Advertencia

El espejismo del audio:

El oyente reconoce conclusiones sin entender metodología. Si tu paper es DiD staggered, el podcast NotebookLM va a decir “effect of X on Y” — sin nombrar Goodman-Bacon, sin Cross-check CS, sin sensitivity.

→ Sirve para atraer, no para defender.

Consejo

Workflow recomendado MAE:

  1. Generá tu Audio Overview en español LATAM (≤12 min) desde NotebookLM.
  2. Subilo a SSRN/RePEc como track adicional al paper.
  3. En la página del paper · link al PDF metodológico justo al lado del audio.
  4. En tu LinkedIn / Twitter académico · audio + thread + link al repo.

→ El podcast NO sustituye el paper · lo distribuye.

Cita ancla: (Flynn, 2025) · (Google NotebookLM, 2025). La pregunta práctica: ¿tu tesis tiene un Audio Overview en español por defecto? · Si no, estás dejando audiencia en la mesa.

🎓 JC 3/4 · 🧊 Data Physicalization · el prop que se ve en cámara (5 min)

Definición canónica (Jansen et al., 2015):

“Artefacto físico cuya geometría o material codifica datos.”

No es decoración · es un canal de comunicación distinto del visual.

Casos icónicos:

  • 🌡️ Warming stripes de Ed Hawkins (2018) — entraron al MoMA en 2025 como pieza de comunicación científica (Hawkins et al., 2025).
  • 🌌 Star Listener — instalación táctil-sonora de datos astrofísicos en biblioteca pública (evaluada in-situ a 2 meses · Behaviour & Information Technology vol.43(14) 2024).
  • 🏠 Perera et al. 2024 — physicalizations de consumo energético en 15 hogares · cambiaron comportamiento medible.
  • 💉 COVID Memorial · bandera con un punto por cada muerte (Suzanne Brennan Firstenberg).

Frontera de catálogo: dataphys.org (Yvonne Jansen · Pierre Dragicevic · Inria).

Consejo

Para tu video poster + Q&A virtual · idea concreta:

¿Cuál es el prop de 10 cm que sostenés frente a la cámara en el momento del hallazgo?

  • 🖨️ 3D print del coeficiente · alza altura proporcional al ATT cuando narrás la magnitud.
  • 🧱 Bloques apilables que representan magnitudes por subgrupo · revelados de a uno.
  • 🧵 “Stripe textil” del efecto temporal · 1 fila por año · color por magnitud.
  • 📦 Caja de muestras con N realista (e.g. 100 frijoles = 100 municipios tratados) volcada sobre la mesa.

Costo marginal: $0-20. Diferenciación frente a slide-deck plano en Zoom: enorme. El jurado se acuerda del prop mucho después de olvidar tu p-value.

Advertencia

Lo que NO es physicalization:

  • ❌ Un PDF impreso a tamaño grande.
  • ❌ Una infografía en cartón.

✅ Algo que se toca y donde la geometría/material codifica datos.

Cita ancla: (Jansen et al., 2015) · (Hawkins et al., 2025) · dataphys.org. En LATAM esto es virtualmente inexplorado · espacio de diferenciación profesional.

🎓 JC 4/4 · 🧠 Ciencias del comportamiento al servicio de la comunicación (5 min)

EAST framework del Behavioural Insights Team UK (Hallsworth et al., 2024) · ~350 citaciones académicas · republicado 2024 con casos de 10 años:

E · Easy
¿Es fácil de escanear? ≤3 clicks · ≤2 minutos.
A · Attractive
¿Hay un número grande en la 1ª línea?
S · Social
¿Menciona una norma · grupo de referencia?
T · Timely
¿Está vinculado a una decisión pública vigente?

El sesgo del autor sobre su propio paper:

  • Hardwicke et al. 2024 (Hardwicke et al., 2024) (arXiv 2502.20581): ~19% de las afirmaciones citantes en psicología tergiversan el paper citado.
  • Equivalente del sunk-cost: el autor sobre-vende su propio efecto.

Nota

🧠 La ciencia del comportamiento al servicio de la comunicación

Tres ideas clave:

  • Framing effects (Tversky-Kahneman): la misma estadística enmarcada distinto produce decisiones opuestas. “Sobrevivirán 1 de 3” vs “morirán 2 de 3” — mismo número, distinta acción del lector.
  • Norma social (Cialdini): citar lo que otros pares hacen mueve más que apelar a autoridad. “7 de 10 economistas LATAM ya usan CS estimator” > “Callaway-Sant’Anna 2021 propuso…”
  • Tiempo y atención (Thaler): el lector decide en 3 segundos si sigue leyendo. La primera frase del abstract es la palanca del paper completo.

→ EAST es el vehículo operativo de estos 3 hallazgos · no es marketing, es diseño cognitivo aplicado a tu paper.

Consejo

Auditoría de spin de tu propio paper (5 min · pedile a un peer):

  1. Lee 3 frases del abstract.
  2. Marcá cada una como CLAIM JUSTIFICADO (datos lo respaldan) o SPIN POTENCIAL (¿hay que matizar?).
  3. Si ≥1 spin → reescribí antes de la defensa.

→ Es la práctica que separa al investigador honesto del que se cree su propia narrativa.

Cita ancla: (Hallsworth et al., 2024) · (Hardwicke et al., 2024). EAST aplicado al abstract = 60 segundos · transformación enorme.

📌 Síntesis · cuatro fronteras · una hoja de ruta (1 min)

Frontera Ganancia Riesgo principal Acción 3-6 meses
🤖 Chatbot del paper Q&A 24/7 · acceso amplificado Alucinación que invierte interpretación Claude Project + disclaimer + audit mensual
🎙️ Audio Overview Reach × 100 · diferenciación SSRN Cognitive offloading · método invisible NotebookLM ES-LATAM + link al PDF
🧊 Physicalization Diferenciación profesional total Que se vea como manualidad, no como datos Objeto 10 cm · 3D print o textil · costo $0-20
🧠 Ciencias del comportamiento Auditoría de spin · honestidad · framing EAST sin teoría se queda en marketing Auditoría EAST + peer-spin check pre-defensa

Compromiso 3-6 meses (lo firmás el día de la defensa): elegí 1 de las 4 fronteras y comprometete a implementarla en tu paper. La maestría termina · esta agenda profesional empieza.

🛠 Cierre logístico · lo que falta para la defensa

13 minutos · peer-assignment · video poster v1 · checklist defensa AIAS 1

🤝 Peer Review · asignación + reglas (5 min)

Cada estudiante recibe 2 video posters para revisar:

  • Asignación algorítmica (no por afinidad) post-commit.
  • Plazo: viernes 22/05 · 23:59 (24h antes de defensa).
  • Entrega: 1-2 pp por revisión + 1 pregunta lista para Q&A.

Rúbrica · 4 ejes del curso:

Eje Peso
1. Pregunta + contribución 25%
2. Identificación causal 25%
3. Comunicación visual 25%
4. Ética + declaración IA 25%

Advertencia

Modo AIAS 1 obligatorio:

  • CERO IA en la revisión. Si hay evidencia de IA en tu texto → descalifica TU peer review.
  • Lo revisás con tu propio criterio. Por eso vale 10%.
  • Es la prueba de que aprendiste a leer críticamente propuestas.

→ La 1 pregunta que formules entra al guion de la defensa: el peer pregunta primero en el Q&A.

Consejo

Extra crédito (opcional · +2% a H4): aplicá EAST + audit de spin (JC 4/4 de hoy) en tu peer review · señalá ≥1 spin en el video poster que revisaste.

🛠 Póster v1 · checklist final + commit obligatorio (5 min)

Antes de cerrar la sesión · cada estudiante valida:

✅ Contenido
  • Título ≤ 12 palabras · incluye contribución
  • Pregunta H1 visible en 5 segundos
  • Gráfico dominante · pasa test 5s
  • Magnitud específica (no "significativo")
  • Limitación honesta · 1 frase
✅ Honestidad
  • QR al repo público
  • "AI Use Disclosure" visible (link)
  • DOI Zenodo (opcional)
  • Modo AIAS dominante declarado por hito
  • Audit logs L1-L5 commiteados

Consejo

Commit obligatorio antes de las 21:00:

git add poster.qmd declaracion-uso-ia.md README.md
git commit -m "U7 v1 · video poster + AI disclosure + reglas EAST aplicadas"
git push

→ Si no hay commit a las 21:00, no hay peer review asignado · sin peer asignado, no podés rendir H4 en la defensa.

🎯 Checklist video poster · entrega asincrónica AIAS 1 (3 min)

Qué entregás · artefactos digitales:

  • 🎬 Video poster 3–5 min subido a YouTube/Vimeo (unlisted)
  • 💻 Repo H4 público · make all corre limpio en máquina virgen
  • 📱 QR al chatbot (si lo armaste) en descripción del video
  • 🧊 Prop visible en el video (JC 3 · bonus de diferenciación)
  • 📋 Declaración AI Use visible (overlay del video + repo)

Qué tu video poster NO contiene:

  • 🚫 Voz IA generada · es TU voz narrando
  • 🚫 Slides hechos 100% por IA sin auditar
  • 🚫 Citas inventadas · alucinaciones · números no verificados
  • 🚫 Spin del hallazgo (auditá con Sprint 2 JC 4)

→ Video poster = AIAS 1 en narración · sin voz sintética · sin guion escrito por IA.

Advertencia

3 preguntas que el peer reviewer (y el JC) van a hacer · respondé en repo:

  1. “¿Qué hizo la IA por ti que tú no hiciste?” — honestidad medida vs declaración.
  2. “¿Qué patrón problemático detectaste en tu propio thread del curso (L5)?” — meta-auditoría.
  3. “Si quitamos la IA · ¿qué párrafo / decisión / gráfico no existiría?” — ese párrafo es el que defendés mejor.

→ Las respuestas van en audit/respuestas-defensa.md del repo · NO en comentarios del video.

Consejo

Ensayo de 90 segundos · hacelo ANTES de grabar: - En tu teléfono, grabate explicando tu hallazgo principal en 90 seg sin notas. - Si necesitás más de 90 seg, no entendiste tu propio trabajo · simplificá. - Si necesitás IA para escribir el guion, el video no es tuyo.

🎓 H4 + Peer + Cierre · entrega asincrónica · día por confirmar. Lo que armaste en 11 días vive en un video de 5 minutos. La narración es tuya · la declaración es tuya · el repo es tuyo.

Sesión 8 · S08 · día por confirmar · 🏁 H4 + Peer + Cierre

Entrega 100% asincrónica · video poster + repo + peer review + manifiesto · sin reunión en vivo

📍 Estructura S08 asincrónica · 5 entregables

Cuándo Entregable Foco Modo
D-2 🎬 Video poster 3-5 min · YouTube/Vimeo unlisted · link al repo + AI Use AIAS 1 narración
D-2 💻 Repo H4 público make all corre limpio · README · sessionInfo · declaración firmada AEA compatible
D-1 🤝 Peer review × 2 1-2 pp por video poster revisado · 4 ejes × 25% · 1 pregunta lista AIAS 1
D-1 📝 Respuestas defensa 3 preguntas en audit/respuestas-defensa.md AIAS 1
D 🎓 Cierre ritual Manifiesto IA² firmado · auto-eval 14 dim · compromiso 3-6 meses —

Advertencia

Asincrónicos post-S08 (S08 · día por confirmar): auto-eval 14 dim · compromiso 3-6 meses · manifiesto firmado en repo.

🎬 Anatomía del video poster · 3-5 min · entregable central asincrónico

📝 Preparación (semana previa) - Slides Quarto-revealjs render limpio (quarto render poster.qmd) - Guion ≤ 600 palabras (≈ 3-5 min hablado pausado) - Prop físico (JC 3) listo si lo usás · prueba de cámara - Audio Overview NotebookLM como referencia opcional (NO reemplaza tu voz)

🎬 Grabación · screencast con voz - Tu voz · NO voz IA sintética · grabás con Loom/OBS/QuickTime - 3-5 min cronometrados · si pasás de 5 min, recortás - Estructura: hook 30s · hallazgo 2min · método 1min · implicación 1min · limitación 30s - Sube a YouTube/Vimeo unlisted · link en README.md del repo

📁 Entrega (asincrónica · día D) - Link del video + descripción con QR al repo + AI Use overlay - audit/respuestas-defensa.md con las 3 preguntas respondidas - Peer reviews de 2 compañeros (modo AIAS 1) entregados D-1 - Manifiesto IA² personal firmado · auto-eval 14 dim · compromiso 3-6 meses - Repo público mínimo 6 meses · DOI Zenodo opcional

🎯 La pregunta del JC · respondela en repo (asincrónica)

“¿Qué hizo la IA por ti que tú no hiciste?”

Cómo se evalúa la respuesta:

Respuesta Lectura
“Nada · todo lo hice yo.” 🚩 Bandera roja — o mentís, o no usaste herramientas del curso.
“Todo · sin IA no habría hecho nada.” 🚩 Bandera roja — la IA no es autora · responsabilidad indelegable.
“Buscó literatura · auditada por mí (L1). Pair programming auditado (L4). Estos 3 párrafos de discusión los reescribí 4 veces porque la IA los hizo genéricos.” ✅ Defensa honesta — operaste en AIAS 2-4, declaraste el modo, mantuviste autoría.

→ La pregunta no busca trampearte · busca confirmar que tu declaración AI Use coincide con tu uso real. Si coinciden, ganás. Si no, perdiste el 35%. Es asincrónica · te tomás el tiempo que necesites · responde con honestidad documentada en audit/respuestas-defensa.md.

Retrospectiva del curso · 40 min

Los 4 ejes del curso · auto-eval

Auto-eval post (14 dimensiones · Likert 1-5):

Eje 1 · Pregunta investigable: - [ ] Sé diferenciar pregunta investigable vs consultoría - [ ] Mi pregunta H4 cumple criterios FINER/COPS - [ ] Sé que puedo equivocarme · espacio de revisión

Eje 2 · Identificación causal: - [ ] Mi DAG es defendible - [ ] Reconozco good vs bad controls - [ ] Mi método empata con mi pregunta de identificación - [ ] Sé qué pre-trends NO son identificación

Eje 3 · Comunicación + reproducibilidad: - [ ] Mi video poster pasa la prueba 5 segundos - [ ] Mi repo es AEA Data Editor compatible - [ ] Tengo gráfico dominante claro - [ ] Puedo traducir a policy brief 2pp

Eje 4 · Ética IA²: - [ ] Mi declaración AI Use está en el repo - [ ] Conozco AIAS 1-5 y cuándo aplica cada uno - [ ] Detecté ≥1 ilusión Messeri-Crockett en mi proceso - [ ] Sé que la detección falla · declaración es el camino

La pregunta de cierre · ¿cómo lo harías hoy?

Si hace 11 días les hubiéramos dicho “haz una propuesta de tesis con IA”,

lo habrían hecho con miedo o con hype.

Hoy, ¿cómo lo harían?

Esa diferencia es lo que aprendieron. Anota la respuesta en tu auto-eval — el viernes la mirás y reconocés si el curso te transformó.

Pregunta-control individual: Si tuviera que hacer un segundo trabajo de grado mañana — sin este profesor · sin este syllabus · solo con la IA y un objeto de estudio — ¿qué haría primero?

→ La respuesta a esa pregunta es el curso destilado.

Cierre ritual · manifiesto IA² firmado

8 minutos · el arco U1 ↔︎ U8 se cierra

Lo que se llevan del curso · destilado

Conceptual:

  • Investigación = método + criterio, no herramientas.
  • IA cambia velocidad, no método.
  • Diseño antes que estimación.
  • Reproducibilidad es la definición operativa de hacer ciencia.
  • Ética IA² es honestidad sobre las ilusiones, no policía.

Operativo:

  • Quarto + git como infraestructura.
  • DAG explícito + adjustment sets.
  • Pipeline literatura humano+IA + caza alucinaciones.
  • DiD moderna + LLMs como datos (3 diagnósticos).
  • Audit log AIAS en cada entrega.
  • Declaración AI Use estilo ICMJE.

Crítico:

Para la vida:

  • Tu tesis es el primer paper, no el último.
  • La transparencia es competencia profesional, no virtud.
  • La IA es colaborador junior — útil, pero requiere supervisión humana.

La pregunta del curso · respondida

La pregunta que abrió U1 (lunes 11/05):

Si la IA puede aumentar mi velocidad 5×, ¿qué hago yo · qué hace la IA · y dónde está la frontera ética?

La respuesta destilada de las 8 sesiones:

Yo hago La IA hace Frontera ética
Pregunta (FINER/COPS) Sugerir variantes Pregunta es mía o no es investigación
DAG + identificación Criticar good/bad controls Causalidad es decisión humana
Lectura crítica de papers Resumen + búsqueda Las 4 ilusiones de Messeri-Crockett
Diseño metodológico Pair programming código Si no audito línea por línea, no es mío
Interpretación de hallazgos Borrador de párrafos La interpretación es indelegable
Defensa frente al jurado NADA AIAS 1 · sin IA al frente
Declarar uso honesto NADA Declaración es responsabilidad indelegable

El arco · S01 abrió, S08 cierra

S01 · Lunes 11/05 · 4h presencial

Abrimos con dos preguntas en pizarra:

“¿Engelbart o Turing?”

“¿Augmentación o automatización?”

Firmaron el Manifiesto IA² del curso — el público. Era una abstracción.

S08 · S08 · día por confirmar · 4h online

Cierran defendiendo su tesis sin IA al frente. Ahora la abstracción tiene cuerpo:

“¿Quién decidió esto?” — tu Lab L5.

“¿Qué hizo la IA por ti que tú no hiciste?” — tu Q&A.

Ahora firmás el Manifiesto IA² personal — el privado. Lo que valió la pena.

No estás compitiendo con la IA. Estás compitiendo con economistas que saben usar IA bien.

Hoy entendiste la diferencia entre las dos competencias.

Manifiesto IA² personal · texto a firmar

Nota

Yo, ___________________________________ (nombre completo), al cierre del curso EC0744 · Seminario de Investigación · MAE · Universidad EAFIT · 23 de mayo de 2026, firmo este manifiesto personal:

  1. Reconozco la diferencia entre augmentación (Engelbart 1962) y automatización (Turing 1950). Elijo la primera como práctica profesional.

  2. Mi tesis es el primer paper, no el último. El repo público que entregué vivirá mínimo hasta noviembre 2026.

  3. La IA no es mi autora. Es mi colaborador junior. Yo soy responsable indelegable de cada decisión científica que firme con mi nombre.

  4. Declararé honestamente el uso de IA en mi tesis, working papers y futuras publicaciones — conforme a (International Committee of Medical Journal Editors, 2023) y (Nature Editorial, 2023).

  5. Reconozco las 4 ilusiones de Messeri-Crockett (profundidad · objetividad · amplitud · comprensión) y me comprometo a auditarlas cuando aparezcan en mi proceso.

  6. Defenderé sin IA lo que defendí hoy: mi propuesta. La augmentación no se transfiere — el juicio es mío.

Firma: ___________________________ Fecha: 23 de mayo de 2026

Repo público: github.com/_____________/_____________

→ Plantilla completa en materiales/manifiesto-personal-ia2.md · firma asincrónica S08 · día por confirmar.

El momento

17 personas entraron a este curso hace 11 días.

17 economistas salen hoy.

Lo que cambia entre esas dos frases es lo que firmaron.

🎓 Tu propuesta de tesis es el primer paper. 🎓

🎓 No el último. 🎓

Gracias · y nos vemos en 3 meses

EC0744 · Seminario de Investigación · MAE EAFIT · 2026-1

Mayo 11 → Mayo 21, 2026

17 economistas · 8 sesiones · 5 hitos · 5 labs IA² · 1 propuesta defendida

🎓 Gracias por estos 11 días. 🎓

Materiales abiertos del curso (CC BY 4.0):

  • 📂 jcmunozmora.github.io/curso_seminario_investigacion
  • 📂 github.com/jcmunozmora/curso_seminario_investigacion
  • 📂 Tu propio repo · público mínimo 6 meses
  • 📂 Tu auto-eval post + firma del compromiso

→ Los slides, fichas, prompts, podcasts, plantillas — todo queda disponible. El curso termina, el aprendizaje sigue.

Próximas lecturas · sigan creciendo

Nota

Para profundizar después del curso:

Lecturas críticas que no pueden saltarse:

Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency (FAccT ’21), 610-623. https://doi.org/10.1145/3442188.3445922
Buchanan, J., Hill, S., & Shapoval, O. (2024). ChatGPT Hallucinates Non-existent Citations: Evidence from Economics. The American Economist, 69(1), 80-87. https://doi.org/10.1177/05694345231218454
Cinelli, C., Forney, A., & Pearl, J. (2024). A Crash Course in Good and Bad Controls. Sociological Methods and Research, 53(3), 1071-1104. https://doi.org/10.1177/00491241221099552
Cunningham, S. (2021). Causal Inference: The Mixtape. Yale University Press.
Family Medicine, A. of. (2024). Quality, Accuracy, and Bias in ChatGPT-Based Summarization of Medical Abstracts. Annals of Family Medicine. https://doi.org/10.1370/afm.3056
Flynn, C. (2025). Usefulness of NotebookLM Audio Overviews for Planetary Scientists. Perspectives of Earth and Space Scientists. https://doi.org/10.1029/2025CN000282
Geng, M., & Trotta, R. (2025). Is ChatGPT a Linguistic Equalizer for Non-Native Speakers? Evidence from 2.8M Articles. arXiv preprint arXiv:2504.12317. https://arxiv.org/abs/2504.12317
Goodman-Bacon, A. (2021). Difference-in-Differences with Variation in Treatment Timing. Journal of Econometrics, 225(2), 254-277. https://doi.org/10.1016/j.jeconom.2021.03.014
Google NotebookLM. (2025). Audio Overviews: 80+ Languages and Deep Dive Formats. Google NotebookLM blog · September 2025. https://notebooklm.gr.com/audio-overviews.html
Hake, J. et al. (2024). Custom GPT for Scientific Writing: A Pilot Study. World Neurosurgery. https://doi.org/10.1016/j.wneu.2024.107574
Hallsworth, M., Service, O., et al. (2024). EAST: Four Simple Ways to Apply Behavioural Insights. Behavioural Insights Team · UK · re-edición 2024. https://www.bi.team/publications/east-four-simple-ways-to-apply-behavioural-insights/
Hardwicke, T. E. et al. (2024). The Noisy Path from Source to Citation · Quantifying Misrepresentation in Academic Citing. arXiv preprint arXiv:2502.20581. https://arxiv.org/abs/2502.20581
Hawkins, E. et al. (2025). Warming Stripes: Climate Communication from Twitter to the MoMA. Bulletin of the American Meteorological Society, 106(5). https://doi.org/10.1175/BAMS-D-24-0212.1
Heath, C., & Heath, D. (2007). Made to Stick: Why Some Ideas Survive and Others Die. Random House.
Hernán, M. A., & Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC.
Huntington-Klein, N. (2022). The Effect: An Introduction to Research Design and Causality. Chapman & Hall/CRC. https://doi.org/10.1201/9781003226055
International Committee of Medical Journal Editors. (2023). Recommendations for the Conduct, Reporting, Editing, and Publication of Scholarly Work in Medical Journals — Update on Artificial Intelligence. https://www.icmje.org/recommendations/.
Ioannidis, J. P. A. (2005). Why Most Published Research Findings Are False. PLoS Medicine, 2(8), e124. https://doi.org/10.1371/journal.pmed.0020124
Jansen, Y., Dragicevic, P., Isenberg, P., Alexander, J., Karnik, A., Kildal, J., Subramanian, S., & Hornbæk, K. (2015). Opportunities and Challenges for Data Physicalization. Proceedings of the 33rd Annual ACM Conference on Human Factors in Computing Systems (CHI ’15), 3227-3236. https://doi.org/10.1145/2702123.2702180
Kobak, D., González-Marquez, R., & Horvát, E.-Á. (2024). Delving into ChatGPT usage in academic writing through excess vocabulary. arXiv preprint arXiv:2406.07016. https://arxiv.org/abs/2406.07016
Korinek, A. (2024). LLMs Level Up—Better, Faster, Cheaper: June 2024 Update to «Generative AI for Economic Research» [Working Paper Update]. University of Virginia; Brookings. https://genaiforecon.org/JEL-2024-June-LLMsLevelUp.pdf
Liang, W., Zhang, Y., Wu, Z., Lepp, H., Ji, W., Zhao, X., Cao, H., Liu, S., He, S., Huang, Z., Zhou, S., Lu, J., Wang, W., Zhang, P., Cao, W., Jain, L., Manning, C. D., & Zou, J. (2025). Mapping the increasing use of LLMs in scientific papers. Patterns (Cell Press). https://www.cell.com/patterns/fulltext/S2666-3899(25)00214-4
Ludwig, J., Mullainathan, S., & Rambachan, A. (2025). Large Language Models: An Applied Econometric Framework (NBER Working Paper 33344). National Bureau of Economic Research. https://doi.org/10.3386/w33344
Messeri, L., & Crockett, M. J. (2024). Artificial Intelligence and Illusions of Understanding in Scientific Research. Nature, 627(8002), 49-58. https://doi.org/10.1038/s41586-024-07146-0
Nature Editorial. (2023). Tools such as ChatGPT threaten transparent science: here are our ground rules for their use. Nature, 613, 612. https://doi.org/10.1038/d41586-023-00191-1
Pearl, J., & Mackenzie, D. (2018). The Book of Why: The New Science of Cause and Effect. Basic Books.
Perkins, M., Furze, L., Roe, J., & MacVaugh, J. (2024). The AI Assessment Scale (AIAS): A Framework for Ethical Integration of Generative AI in Educational Assessment. Journal of University Teaching and Learning Practice, 21(6). https://doi.org/10.53761/q3azde36
Perkins, M., Roe, J., Postma, D., McGaughran, J., & Hickerson, D. (2024). Detection of GPT-4 Generated Text in Higher Education: Combining Academic Judgement and Software to Identify Generative AI Tool Misuse. Journal of Academic Ethics, 22, 89-113. https://doi.org/10.1007/s10805-023-09492-6
Peters, U., & Chin-Yee, B. (2025). Generalization Bias in LLM Summarization of Scientific Texts. Royal Society Open Science. https://doi.org/10.1098/rsos.241776
Saasnik. (2026). AI Tools for Researchers · Adoption Survey 2026. https://saasnik.com/ai-tools-for-researchers-in-2026/.
Schwabish, J. (2021). Better Data Visualizations: A Guide for Scholars, Researchers, and Wonks. Columbia University Press.
Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant. Psychological Science, 22(11), 1359-1366. https://doi.org/10.1177/0956797611417632
Simonsohn, U., Nelson, L. D., & Simmons, J. P. (2014). P-curve: A Key to the File-Drawer. Journal of Experimental Psychology: General, 143(2), 534-547. https://doi.org/10.1037/a0033242
Vilhuber, L. (2020). Reproducibility and Replicability in Economics. Harvard Data Science Review, 2(4). https://doi.org/10.1162/99608f92.4f6b9e67
Wilke, C. O. (2019). Fundamentals of Data Visualization: A Primer on Making Informative and Compelling Figures. O’Reilly Media.
Young, E., & Mendizabal, E. (2009). Helping Researchers Become Policy Entrepreneurs: How to Develop Engagement Strategies for Evidence-Based Policy-Making. ODI Briefing Paper, (53). https://odi.org/en/publications/helping-researchers-become-policy-entrepreneurs/
15:00