Lab IA²-2 · Triangulación aumentada

Sesión S04 · 3 modelos de IA, una decisión humana

Autor/a
Afiliación

Juan Carlos Muñoz-Mora, PhD

Universidad EAFIT · Escuela de Finanzas, Economía y Gobierno

Fecha de publicación

25 de mayo de 2026

La pregunta de augmentación

Cuando 3 modelos me dan 3 outputs distintos para la misma pregunta, ¿cómo decido qué es señal y qué es ruido?

Modo AIAS: 5 — Full AI · Sesión: S04 · Duración: 80 min · Producto: matriz 3×N + decisión razonada.

Contexto

Lau et al. (2025, Cochrane CESM) (Lau et al., 2025) documentaron que Elicit tiene recall ~40% vs revisión tradicional ~95%. Si usas SOLO Elicit, te pierdes >60% de la literatura relevante. Khraisha et al. (2024) (Khraisha et al., 2024) mostraron variabilidad similar entre modelos LLM en tareas de screening.

Este lab te entrena a triangular entre múltiples modelos para decidir humanamente qué papers son relevantes.

Objetivos

  1. Correr la misma query en 3 herramientas IA distintas (Elicit, Consensus, Scite + 1 alternativa).
  2. Construir matriz 3×N de coincidencias y discrepancias.
  3. Calcular Jaccard entre pares de modelos.
  4. Documentar decisión humana sobre qué papers incluir.

Procedimiento

Paso 1 — Definir query unificada (10 min)

Construye una sola query que usarás en 3 herramientas:

Query: [palabras clave + booleanos]
Filtros: años 2015-2026, peer-review, idiomas EN/ES.

Paso 2 — Correr en 3 herramientas (30 min)

Herramienta URL Output esperado
Elicit elicit.com Top 10-20 papers
Consensus consensus.app Top 10-20 papers
Scite scite.ai Top 10-20 papers + smart citations
Research Rabbit (opcional) researchrabbit.ai Mapa de papers conectados

Exporta los resultados (CSV o lista de DOIs).

Paso 3 — Matriz 3×N de comparación (30 min)

Construye en 04-labs/02-triangulacion-aumentada/matriz.csv:

DOI Título Elicit Consensus Scite ¿Incluir? Razón
10.1257/aer.x Paper A ✓ ✓ ✓ SÍ Top 3 en los tres
10.1093/qje.y Paper B ✓ ✗ ✓ SÍ Aparece en 2/3
10.1086/z Paper C ✗ ✓ ✗ NO Solo Consensus, fuera de tema al revisar abstract

Cálculos:

  • Jaccard Elicit ∩ Consensus: |intersección| / |unión|
  • Jaccard Elicit ∩ Scite: …
  • Jaccard Consensus ∩ Scite: …

Paso 4 — Decisión humana razonada (10 min)

Responde en 04-labs/02-triangulacion-aumentada/decision.md:

  1. ¿Cuántos papers únicos aparecen en al menos uno de los 3 modelos?
  2. ¿Cuántos en los 3 (consenso fuerte)?
  3. ¿Hay papers que tú agregarías que NINGÚN modelo identificó? ¿Por qué los modelos los perdieron?
  4. ¿La triangulación te aumentó (te dio mejor cobertura) o te confundió (más ruido para procesar)?

Audit log obligatorio

Llena el audit-template.md con: prompts usados, resultados crudos, decisiones de inclusión/exclusión.

Regla de aprobación

✅ Lab aprobado si: - Matriz con ≥20 papers únicos comparados. - Jaccard calculado para los 3 pares de modelos. - Decisión humana documentada con justificación por paper. - Audit log completo.

Conexión con el curso

Este lab alimenta directamente H2 Evidence Map. La triangulación es el primer filtro; la lectura crítica humana es el segundo.

Recursos

Volver arriba

Referencias

Atkinson, C. F. (2024). Cheap, Quick, and Rigorous: Artificial Intelligence and the Systematic Literature Review. Social Science Computer Review, 42(2), 376-393. https://doi.org/10.1177/08944393231196281
Khraisha, Q., Put, S., Kappenberg, J., Warraitch, A., & Hadfield, K. (2024). Can Large Language Models Replace Humans in Systematic Reviews? Evaluating GPT-4’s Efficacy in Screening and Extracting Data from Peer-Reviewed and Grey Literature in Multiple Languages. Research Synthesis Methods, 15(4), 616-626. https://doi.org/10.1002/jrsm.1715
Lau, J. et al. (2025). Comparison of Elicit AI and Traditional Literature Searching in Evidence Syntheses Using Four Case Studies. Cochrane Evidence Synthesis and Methods, 3(5). https://doi.org/10.1002/cesm.70050