Lab IA²-2 · Triangulación aumentada
Sesión S04 · 3 modelos de IA, una decisión humana
Contexto
Lau et al. (2025, Cochrane CESM) (Lau et al., 2025) documentaron que Elicit tiene recall ~40% vs revisión tradicional ~95%. Si usas SOLO Elicit, te pierdes >60% de la literatura relevante. Khraisha et al. (2024) (Khraisha et al., 2024) mostraron variabilidad similar entre modelos LLM en tareas de screening.
Este lab te entrena a triangular entre múltiples modelos para decidir humanamente qué papers son relevantes.
Objetivos
- Correr la misma query en 3 herramientas IA distintas (Elicit, Consensus, Scite + 1 alternativa).
- Construir matriz 3×N de coincidencias y discrepancias.
- Calcular Jaccard entre pares de modelos.
- Documentar decisión humana sobre qué papers incluir.
Procedimiento
Paso 1 — Definir query unificada (10 min)
Construye una sola query que usarás en 3 herramientas:
Query: [palabras clave + booleanos]
Filtros: años 2015-2026, peer-review, idiomas EN/ES.
Paso 2 — Correr en 3 herramientas (30 min)
| Herramienta | URL | Output esperado |
|---|---|---|
| Elicit | elicit.com | Top 10-20 papers |
| Consensus | consensus.app | Top 10-20 papers |
| Scite | scite.ai | Top 10-20 papers + smart citations |
| Research Rabbit (opcional) | researchrabbit.ai | Mapa de papers conectados |
Exporta los resultados (CSV o lista de DOIs).
Paso 3 — Matriz 3×N de comparación (30 min)
Construye en 04-labs/02-triangulacion-aumentada/matriz.csv:
| DOI | Título | Elicit | Consensus | Scite | ¿Incluir? | Razón |
|---|---|---|---|---|---|---|
| 10.1257/aer.x | Paper A | ✓ | ✓ | ✓ | SÍ | Top 3 en los tres |
| 10.1093/qje.y | Paper B | ✓ | ✗ | ✓ | SÍ | Aparece en 2/3 |
| 10.1086/z | Paper C | ✗ | ✓ | ✗ | NO | Solo Consensus, fuera de tema al revisar abstract |
Cálculos:
- Jaccard Elicit ∩ Consensus: |intersección| / |unión|
- Jaccard Elicit ∩ Scite: …
- Jaccard Consensus ∩ Scite: …
Paso 4 — Decisión humana razonada (10 min)
Responde en 04-labs/02-triangulacion-aumentada/decision.md:
- ¿Cuántos papers únicos aparecen en al menos uno de los 3 modelos?
- ¿Cuántos en los 3 (consenso fuerte)?
- ¿Hay papers que tú agregarías que NINGÚN modelo identificó? ¿Por qué los modelos los perdieron?
- ¿La triangulación te aumentó (te dio mejor cobertura) o te confundió (más ruido para procesar)?
Audit log obligatorio
Llena el audit-template.md con: prompts usados, resultados crudos, decisiones de inclusión/exclusión.
Regla de aprobación
✅ Lab aprobado si: - Matriz con ≥20 papers únicos comparados. - Jaccard calculado para los 3 pares de modelos. - Decisión humana documentada con justificación por paper. - Audit log completo.
Conexión con el curso
Este lab alimenta directamente H2 Evidence Map. La triangulación es el primer filtro; la lectura crítica humana es el segundo.
Recursos
- (Lau et al., 2025) — Elicit recall vs tradicional
- (Khraisha et al., 2024) — GPT-4 en SR
- (Atkinson, 2024) — protocolo híbrido humano+IA