---
citekey: BuchananHillShapoval2024
priority: nucleo
units: [U1, U4]
type: article
venue: The American Economist
year: 2024
status: shadow (sin PDF en repo — biblioteca EAFIT, SAGE journals)
---

# Buchanan, Hill & Shapoval 2024 — ChatGPT Hallucinates Non-existent Citations: Evidence from Economics

**Cita.** Buchanan, J., Hill, S., & Shapoval, O. (2024). ChatGPT hallucinates non-existent citations: Evidence from economics. *The American Economist*, 69(1), 80–87. DOI: 10.1177/05694345231218454.

**Citekey Quarto:** `[@BuchananHillShapoval2024]`

## Tesis central

Las alucinaciones de citas en LLMs **no son raras** ni **fáciles de detectar** en el dominio de economía. Buchanan, Hill & Shapoval (universidades estadounidenses regionales) hicieron el primer estudio sistemático: pidieron a ChatGPT 200 citas sobre tópicos económicos y verificaron cada una en bases bibliográficas. **Más del 30% no existían.** Más grave: las alucinaciones eran **plausibles** — autores reales con títulos inventados, journals reales con artículos inexistentes. Para un lector no-experto (revisor de tesis, comité editorial sin tiempo), el error es **invisible**.

## Aporte por unidad del curso

- **U1 (Intro IA):** Es **el caso de ética post-LLM** que reemplaza/complementa a Stapel/Wansink/Reinhart-Rogoff. Demuestra el riesgo concreto de delegar literatura a IA sin verificación.
- **U4 (Lit review):** Es la **prueba empírica** que justifica el ejercicio "caza de alucinaciones" del curso. Sin este paper, el ejercicio se sentiría paranoico; con él, es razonable.

## Diseño del estudio

- **Procedimiento:** pidieron a ChatGPT (versión disponible en 2023) **200 citas** sobre 10 tópicos centrales de economía aplicada (mercado laboral, microfinanzas, evaluación de impacto, comercio internacional, etc.).
- **Verificación:** cada cita verificada en Google Scholar, Web of Science, EconLit, JSTOR, y resolución directa de DOI.
- **Categorización:**
  1. **Verificada y correcta** (autor, año, journal, páginas, DOI).
  2. **Existe pero metadata incorrecta** (autor real, título inventado; o título real, autor incorrecto).
  3. **No existe en absoluto.**

## Hallazgos clave (citables para slide)

- **>30% de citas eran fabricaciones completas** (no existían).
- Adicionales **~15-20%** tenían **metadata incorrecta** (autor real con título inventado, etc.).
- Las alucinaciones eran **plausibles**:
  - Autores reales con publicaciones reales en el campo (no nombres random).
  - Journals reales (AER, JPE, JDE) con artículos inexistentes.
  - Años plausibles, formato de cita correcto.
- **El error es no-detectable** para un lector que no verifica activamente.
- **No hay patrón claro** entre tópicos: las alucinaciones aparecen en todas las áreas analizadas.

## Citas textuales destacadas

> *"The fabricated citations were highly plausible — they used real journal names, plausible publication years, and authors who actually publish in those areas. A reader who does not actively verify cannot distinguish them from genuine citations."*

> *"Our findings suggest that ChatGPT, in its current form, is not a reliable tool for generating citations in economics research."*

## Conexiones con otras lecturas del bib

- **Crítica fundacional:** `[@BenderGebru2021]` Stochastic Parrots — explica por qué LLMs alucinan estructuralmente.
- **Crítica epistémica:** `[@MesseriCrockett2024]` Nature — ilusión de comprensión.
- **Aplicación pedagógica:** `[@khraisha2024can]` (RSM) — GPT-4 para systematic review.
- **Marco institucional:** `[@Perkins2024Detection]` — software de detección no funciona.

## Limitaciones y críticas

- **Versión específica de ChatGPT (2023).** Modelos posteriores (GPT-4 con browsing, Claude con web search) reducen tasa pero no la eliminan.
- **n=200 citas** — robusto pero no exhaustivo.
- **Sin comparativa con otros modelos** (Claude, Gemini) en el mismo estudio.
- **No prueban si los lectores detectan o no** — asumen que pasan desapercibidas.

## Implicación pedagógica para el curso

> **Toda cita generada por IA se verifica en fuente original — no en otra IA.**

→ Workflow obligatorio del curso:
1. ChatGPT/Claude sugieren referencias.
2. Estudiante verifica cada una en Scopus/WoS/Google Scholar/DOI.
3. Si una cita "no se encuentra" → casi seguro es alucinación.
4. Reportar tasa de alucinaciones encontradas en el audit log.

## Pregunta detonadora para clase

> Si Buchanan et al. encontraron >30% en 2024, **¿cuál creen que es la tasa hoy con GPT-4o o Claude 3.5?** ¿Cómo lo verifican empíricamente?

## Slide de aterrizaje sugerido

- **Título:** "El experimento Buchanan 2024 — >30% de citas alucinadas en economía"
- **Visual:** ejemplo de cita alucinada plausible vs cita real.
- **Bullet de cierre:** *"La IA puede inventar literatura que parece literatura. Verifica en fuente — no en otra IA."*

## Lectura mínima si el tiempo es escaso

- 8 páginas — leer todo. Es corto y operativo.
- Tabla 1 (categorización de hallazgos) es lo más citable.
