Sesión 8 — ¿Cómo evaluar? Métodos, elección y comunicación de resultados
Universidad EAFIT · Formación ejecutiva para Comfama
2026-09-11
Viernes 11 de septiembre · 10:00–13:00 · Presencial · Última sesión
Todo método de recolección presenta falencias y vacíos que no puede llenar.
Lo que gana en confiabilidad para generalizar, lo pierde en detalle. Y al revés.
Por eso la pregunta no es “¿cuál es el mejor método?”. Es “¿qué necesito poder afirmar, y qué estoy dispuesta a no saber?”
| Diseño | Qué permite afirmar | Qué exige |
|---|---|---|
| Experimental (asignación aleatoria) | Este programa causó este cambio | Grupo de control, aleatorización, tamaño, ética |
| Cuasi-experimental (diferencias en diferencias, emparejamiento, regresión discontinua) | Este cambio es plausiblemente atribuible | Un grupo de comparación creíble y datos previos |
| Antes–después sin comparación | Hubo un cambio — no por qué | Línea de base |
| Basado en teoría (análisis de contribución) | La cadena se sostiene y las alternativas no explican mejor | Una ToC declarada y evidencia por eslabón |
| Basado en caso (estudio de caso, cosecha) | Esto ocurrió aquí, y así se relaciona con el programa | Protocolo y verificación |
Stern, Stame, Mayne, Forss, Davies & Befani (2012), Broadening the Range of Designs and Methods for Impact Evaluations, DFID Working Paper 38
| Lo que quiero saber | El método que lo responde |
|---|---|
| ¿A cuánta gente llegamos, y quiénes son? | Registros del programa · encuesta propia |
| ¿Mejoraron frente a quienes no participaron? | Diseño con grupo de comparación |
| ¿Por qué funcionó con unos y con otros no? | Entrevistas · estudio de caso |
| ¿Qué cambió que no habíamos previsto? | Cosecha de resultados |
| De todo lo que cambió, ¿qué importa más según ellos? | Most Significant Change |
El error más común va al revés: se elige la encuesta porque es lo que sabemos hacer, y solo después se piensa qué preguntarle.
| Monitoreo | Evaluación | |
|---|---|---|
| Qué mira | Insumos, actividades, productos | Resultados e impacto |
| Cada cuánto | Continuo · semanal a trimestral | Periódico · en hitos de decisión |
| Qué pregunta | ¿Vamos según lo previsto? | ¿Esto está funcionando, y por qué? |
| Quién lo usa | Quien opera el programa | Quien decide continuar, ajustar o cerrar |
Confundirlos es caro en las dos direcciones: evaluar con frecuencia de monitoreo agota al equipo y no alcanza a ver el cambio; monitorear con frecuencia de evaluación deja la operación a ciegas.
Cuatro preguntas para determinar el ciclo
1. ¿Qué decisión se va a tomar con este dato?
2. ¿Cuándo se toma esa decisión? (comité mensual, cierre de convenio, planeación anual)
3. ¿Cada cuánto cambia de verdad lo que estoy midiendo?
4. ¿Cuánto cuesta recogerlo, en plata y en tiempo del equipo?
El ciclo es el más lento de los cuatro. Medir más seguido produce datos que nadie usa; medir más espaciado, decisiones que nadie sustenta.
| Nivel | Frecuencia razonable | Por qué |
|---|---|---|
| Insumos y actividades | Mensual | Cambian con la operación y sirven para corregir sobre la marcha |
| Productos | Mensual o trimestral | Se acumulan con la entrega; el trimestre suele coincidir con el comité |
| Resultados intermedios | Semestral o anual | Necesitan que el participante haga algo con lo que recibió |
| Impacto | Cada 2 a 5 años, o al cierre | Es el que más tarda en aparecer y el más costoso de medir |
El tiempo de maduración. Medir un resultado antes de que alcance a ocurrir no da un cero: da un falso negativo — y con él se cierran programas que sí funcionaban.
Frecuencias de monitoreo —semanal, mensual, bimestral, trimestral, semestral, anual— según Función Pública (2018), p. 57
Medir demasiado seguido
Produce ruido que se confunde con señal. Cuesta tiempo del equipo. Cansa a quien responde la encuesta.
Y genera tableros que nadie abre, porque nada cambió desde la semana pasada.
Medir demasiado espaciado
Cuando llega el dato, la decisión ya se tomó sin él.
Y no queda margen para corregir: el hallazgo llega cuando el programa ya terminó.
La prueba: ¿qué haríamos distinto si este dato llegara un mes antes, o un mes después? Si la respuesta es “nada”, la frecuencia está mal elegida.
| Familia | Qué hace | Cuándo NO usarlo |
|---|---|---|
| Experimental · asignación aleatoria | Compara con un grupo equivalente creado por azar | Cuando excluir a alguien del programa no es ético ni viable |
| Diferencias en diferencias | Compara el cambio de los participantes con el de un grupo parecido | Si los dos grupos ya venían con tendencias distintas |
| Emparejamiento | Construye un grupo de comparación estadísticamente similar | Si lo que determina quién entra al programa no se observa |
| Regresión discontinua | Compara a quienes quedaron justo por encima y por debajo de un corte | Si no hay un umbral real de elegibilidad |
| Antes–después | Mide el cambio del grupo en el tiempo | Siempre que se quiera afirmar causalidad: no la sostiene |
Gertler, Martinez, Premand, Rawlings & Vermeersch (2016), Impact Evaluation in Practice, 2ª ed., Banco Mundial · BID
| Método | Qué pregunta responde | Cuándo NO usarlo |
|---|---|---|
| Entrevista en profundidad | ¿Qué significó esto para esta persona? | Cuando se necesita magnitud o cobertura |
| Grupo focal | ¿Qué se dice colectivamente, y qué no se dice? | Con temas sensibles o con jerarquías en la sala |
| Observación | ¿Qué pasa de verdad, más allá de lo que se declara? | Cuando la presencia del observador altera el hecho |
| Estudio de caso | ¿Cómo funcionó el mecanismo en este contexto? | Para generalizar a toda la población |
| Outcome harvesting | ¿Qué cambió que no habíamos previsto? | Cuando ya se sabe exactamente qué se busca |
| Most Significant Change | De todo lo que cambió, ¿qué considera la gente lo más importante? | Cuando no hay tiempo: exige varias rondas de selección |
Wilson-Grau & Britt (2012, rev. 2013), Outcome Harvesting · Davies & Dart (2005), The MSC Technique: A Guide to Its Use, v1.00
| Diseño | Cómo se arma | Para qué sirve |
|---|---|---|
| Convergente | Cuantitativo y cualitativo a la vez, se comparan los resultados | Contrastar si ambas fuentes cuentan la misma historia |
| Explicativo secuencial | Primero los números, luego se va a buscar por qué | Cuando el dato muestra algo raro y no se sabe la causa |
| Exploratorio secuencial | Primero lo cualitativo, y con eso se construye el instrumento | Cuando no se sabe todavía qué preguntar ni cómo |
Un diseño mixto no es poner una cita de beneficiario al final del informe de cifras. Es que una fuente cambie lo que se le pregunta a la otra.
Creswell & Plano Clark (2018), Designing and Conducting Mixed Methods Research, 3ª ed., SAGE
Los demás métodos parten de los objetivos y van a ver si se cumplieron. La cosecha parte de lo que ya ocurrió y va hacia atrás a preguntar si el programa tuvo algo que ver.
| Qué produce | Enunciados de resultado: quién cambió qué, cuándo y dónde, y cómo se relaciona con el programa |
| Qué lo hace riguroso | La verificación con fuentes independientes: alguien que no sea el programa confirma que eso pasó |
| Cuándo usarlo | Programas abiertos, con muchos actores, o cuando no se sabe de antemano qué buscar |
| Cuándo NO | Cuando la pregunta es de magnitud, o cuando ya se sabe exactamente qué se quiere medir |
Wilson-Grau & Britt (2012, rev. noviembre 2013), Outcome Harvesting, Ford Foundation MENA Office
No pregunta si el cambio ocurrió. Pregunta cuál de todos los cambios importa más — y deja que sean los propios participantes quienes lo decidan.
| Qué produce | Relatos de cambio significativo, seleccionados en rondas sucesivas por distintos niveles de la organización |
| Dónde está el valor | No en el relato ganador, sino en la discusión sobre por qué ese y no otro: ahí se hace explícito qué valora cada quien |
| Cuándo usarlo | Cuando importa el criterio de valor de la gente, no solo el del programa |
| Cuándo NO | Cuando no hay tiempo: exige varias rondas y varios niveles de selección |
Davies & Dart (2005), The ‘Most Significant Change’ (MSC) Technique: A Guide to Its Use, v1.00
| Cosecha de resultados | Most Significant Change | |
|---|---|---|
| Pregunta | ¿Qué cambió que no habíamos previsto? | ¿Cuál de los cambios importa más? |
| Quién decide qué vale | El evaluador, con verificación externa | Los participantes, en rondas de selección |
| Se elige cuando | No se sabe qué buscar | Sí se sabe, pero no qué priorizar |
| Su riesgo | Quedarse en anécdota sin verificar | Volverse un concurso de historias bonitas |
| Método | Qué hace | Cuándo sirve |
|---|---|---|
| Análisis de contribución | Construye y pone a prueba la historia causal del programa, y examina si explicaciones alternativas la superan | Cuando no hay grupo de comparación posible pero sí una teoría de cambio declarada |
| Estudio de caso | Reconstruye en profundidad cómo funcionó el mecanismo en un contexto concreto | Cuando interesa el cómo y el en qué condiciones, no el promedio |
| Sistematización de experiencias | Ordena e interpreta la propia práctica con quienes la vivieron, para extraer aprendizajes | Cuando el equipo acumuló experiencia y no la ha convertido en conocimiento |
Y los participativos —cartografía social, fotovoz, líneas de tiempo colectivas— que no solo recogen información: cambian quién tiene voz en la evaluación.
Mayne (2008), Contribution Analysis: An Approach to Exploring Cause and Effect, ILAC Brief 16 · Jara Holliday, La sistematización de experiencias: práctica y teoría para otros mundos posibles, CINDE–CEAAL
| El reto | Cómo se enfrenta |
|---|---|
| “Esto son solo anécdotas” — no convence a quien decide | Verificar con fuentes independientes y triangular: el mismo hecho, contado por tres actores distintos |
| Sesgo del entrevistador y deseabilidad social — la gente dice lo que cree que uno quiere oír | Que entreviste alguien que no sea responsable del programa. Preguntar por hechos antes que por opiniones |
| Volumen y tiempo de análisis | Muestreo intencional, no maximizar el número. Se para cuando deja de aparecer información nueva |
| Generalización indebida | Declarar el alcance: “esto ocurrió aquí, en estas condiciones” — y no más |
| Riesgo ético de exponer a la persona | Consentimiento informado, anonimización y devolución: nadie entrega su relato para no volver a saber de él |
Sirve para ordenar volumen: transcribir, agrupar, encontrar repeticiones. Cuesta caro cuando se le pide el hallazgo: lo que aparece una sola vez es lo que tiende a borrar.
| Criterio | Qué pregunta | Cómo se consigue |
|---|---|---|
| Credibilidad | ¿Lo reportado corresponde a lo que las personas dijeron y vivieron? | Triangulación · devolución a los participantes · permanencia prolongada en campo |
| Transferibilidad | ¿Este hallazgo puede decir algo en otro contexto? | Descripción densa del contexto: que quien lee juzgue si se parece al suyo |
| Dependabilidad | ¿Otra persona, con los mismos datos, llegaría a algo parecido? | Registro auditable de las decisiones de análisis |
| Confirmabilidad | ¿El hallazgo viene de los datos o de las expectativas del evaluador? | Trazabilidad del dato al enunciado · revisión entre pares |
La verificación de la cosecha de resultados es exactamente esto: credibilidad puesta a operar.
Lincoln & Guba (1985), Naturalistic Inquiry, Sage — criterios de trustworthiness
| # | Sección | La prueba de que está bien escrita |
|---|---|---|
| 1 | La decisión que este reporte informa | Es una oración, no un resumen del programa |
| 2 | Lo que sabemos | Son los indicadores que sí tienen dato |
| 3 | Lo que no sabíamos que estaba pasando | Es el resultado cosechado hoy |
| 4 | El supuesto que pusimos a prueba | Nombra el supuesto frágil de la Ficha 2 |
| 5 | Recomendación | Nombra una decisión concreta y quién la toma |
Lo que no se sabe, se escribe
“SIN DATO” en el reporte vale más que una estimación cómoda. Quien lee necesita saber qué está firme y qué no.
Contribución, no logro
Se reporta aquello a lo que contribuimos. Escribir “logramos” donde solo contribuimos es la forma más común de mentir sin decir una falsedad.
Lo negativo también se reporta
Un reporte donde todo salió bien no es un buen reporte: es un reporte incompleto o un programa que no se miró de verdad.
| Formato | Qué es | Cuándo sirve |
|---|---|---|
| 1 : 3 : 25 | Una página de mensajes clave, tres de resumen ejecutivo, veinticinco de informe completo | Cuando hay públicos distintos y ninguno lee el documento del otro |
| Fiesta de datos (data party) | Se llevan los datos sin conclusiones y los actores los interpretan en sesión | Cuando se quiere que quien decide se apropie del hallazgo |
| Narrativa de datos | Un solo mensaje, un gráfico que lo sostiene, y una historia con tensión y desenlace | Cuando hay que mover a alguien a actuar, no solo informarle |
| Visual y audiovisual | Infografía, video de dos minutos, fotovoz | Cuando el público no lee informes, o cuando la voz de la gente es el hallazgo |
| Tablero vivo | Los indicadores actualizados y disponibles para consulta permanente | Para monitoreo continuo — no reemplaza el reporte de decisión |
1:3:25 — Canadian Health Services Research Foundation, vía BetterEvaluation · Narrativa de datos — Knaflic (2015), Storytelling with Data, Wiley
Contradatos · Colombia
Dispositivos físicos e interactivos que interrumpen el espacio público y detonan conversaciones cara a cara, en vez de encuestas digitales.
El dato no entrega la respuesta: abre la pregunta.
Su principio de la deriva: quedarse atento al hallazgo inesperado que aparece en la interacción, y dejar que reformule la pregunta inicial.
Asistidas por IA
Sirve para traducir un mismo hallazgo a públicos distintos: la página de mensajes clave, el resumen ejecutivo, el texto para el boletín.
También para proponer visualizaciones alternativas y bajar el lenguaje técnico.
El límite: redacta, no decide el mensaje — y sigue suavizando lo atípico.
Contradatos — iniciativa de María Armenta y Mateo Acosta, difundida por Escuela de Datos
Qué nos llevamos
Una idea que se pueda usar el lunes.
Algo que hacíamos y que ya no haríamos igual.
La pregunta que quedó abierta y con la que nos vamos.
Qué se puede ajustar
Qué sobró y qué faltó en estas ocho sesiones.
Qué habría necesitado más tiempo.
Qué le dirían a un equipo que vaya a tomar este curso el año entrante.
Medición y Valoración del Impacto Social · EAFIT–Comfama