Medición y Valoración del Impacto Social

Sesión 8 — ¿Cómo evaluar? Métodos, elección y comunicación de resultados

Paola Velásquez · Juan Carlos Muñoz-Mora

Universidad EAFIT · Formación ejecutiva para Comfama

2026-09-11

S8 · ¿Cómo evaluar?

Viernes 11 de septiembre · 10:00–13:00 · Presencial · Última sesión

Sabemos cuándo evaluar
y con qué vara juzgar.
Falta el método.
Y al final del día, lo que decide si todo esto sirvió: cómo se cuenta.

No hay un método mejor: hay preguntas distintas

Todo método de recolección presenta falencias y vacíos que no puede llenar.

Lo que gana en confiabilidad para generalizar, lo pierde en detalle. Y al revés.

Por eso la pregunta no es “¿cuál es el mejor método?”. Es “¿qué necesito poder afirmar, y qué estoy dispuesta a no saber?”

El espectro completo

↑ Más confiable para generalizar, más comparable Registros administrativos Encuestas a gran escala Encuesta propia al programa Grupos focales y entrevistas Historias de vida y etnografía miles de casos · ¿cuántos? muestra representativa · ¿quiénes? cientos · ¿cuántos y por qué? decenas · ¿qué significó? unidades · ¿cómo se vivió? ↓ Más detalle, más contexto, más matiz

Qué permite afirmar cada diseño

Diseño Qué permite afirmar Qué exige
Experimental (asignación aleatoria) Este programa causó este cambio Grupo de control, aleatorización, tamaño, ética
Cuasi-experimental (diferencias en diferencias, emparejamiento, regresión discontinua) Este cambio es plausiblemente atribuible Un grupo de comparación creíble y datos previos
Antes–después sin comparación Hubo un cambio — no por qué Línea de base
Basado en teoría (análisis de contribución) La cadena se sostiene y las alternativas no explican mejor Una ToC declarada y evidencia por eslabón
Basado en caso (estudio de caso, cosecha) Esto ocurrió aquí, y así se relaciona con el programa Protocolo y verificación

Stern, Stame, Mayne, Forss, Davies & Befani (2012), Broadening the Range of Designs and Methods for Impact Evaluations, DFID Working Paper 38

Primero la pregunta, después el método

Lo que quiero saber El método que lo responde
¿A cuánta gente llegamos, y quiénes son? Registros del programa · encuesta propia
¿Mejoraron frente a quienes no participaron? Diseño con grupo de comparación
¿Por qué funcionó con unos y con otros no? Entrevistas · estudio de caso
¿Qué cambió que no habíamos previsto? Cosecha de resultados
De todo lo que cambió, ¿qué importa más según ellos? Most Significant Change

El error más común va al revés: se elige la encuesta porque es lo que sabemos hacer, y solo después se piensa qué preguntarle.

1 · ¿Cada cuánto medir?

Monitorear y evaluar no usan el mismo reloj

Monitoreo Evaluación
Qué mira Insumos, actividades, productos Resultados e impacto
Cada cuánto Continuo · semanal a trimestral Periódico · en hitos de decisión
Qué pregunta ¿Vamos según lo previsto? ¿Esto está funcionando, y por qué?
Quién lo usa Quien opera el programa Quien decide continuar, ajustar o cerrar

Confundirlos es caro en las dos direcciones: evaluar con frecuencia de monitoreo agota al equipo y no alcanza a ver el cambio; monitorear con frecuencia de evaluación deja la operación a ciegas.

La frecuencia la fija la decisión, no el dato

Cuatro preguntas para determinar el ciclo

1. ¿Qué decisión se va a tomar con este dato?

2. ¿Cuándo se toma esa decisión? (comité mensual, cierre de convenio, planeación anual)

3. ¿Cada cuánto cambia de verdad lo que estoy midiendo?

4. ¿Cuánto cuesta recogerlo, en plata y en tiempo del equipo?

El ciclo es el más lento de los cuatro. Medir más seguido produce datos que nadie usa; medir más espaciado, decisiones que nadie sustenta.

Cada nivel de la cadena tiene su propio reloj

Nivel Frecuencia razonable Por qué
Insumos y actividades Mensual Cambian con la operación y sirven para corregir sobre la marcha
Productos Mensual o trimestral Se acumulan con la entrega; el trimestre suele coincidir con el comité
Resultados intermedios Semestral o anual Necesitan que el participante haga algo con lo que recibió
Impacto Cada 2 a 5 años, o al cierre Es el que más tarda en aparecer y el más costoso de medir

El tiempo de maduración. Medir un resultado antes de que alcance a ocurrir no da un cero: da un falso negativo — y con él se cierran programas que sí funcionaban.

Frecuencias de monitoreo —semanal, mensual, bimestral, trimestral, semestral, anual— según Función Pública (2018), p. 57

Dos errores simétricos

Medir demasiado seguido

Produce ruido que se confunde con señal. Cuesta tiempo del equipo. Cansa a quien responde la encuesta.

Y genera tableros que nadie abre, porque nada cambió desde la semana pasada.

Medir demasiado espaciado

Cuando llega el dato, la decisión ya se tomó sin él.

Y no queda margen para corregir: el hallazgo llega cuando el programa ya terminó.

La prueba: ¿qué haríamos distinto si este dato llegara un mes antes, o un mes después? Si la respuesta es “nada”, la frecuencia está mal elegida.

2 · Los métodos, en concreto

Cuantitativos

Familia Qué hace Cuándo NO usarlo
Experimental · asignación aleatoria Compara con un grupo equivalente creado por azar Cuando excluir a alguien del programa no es ético ni viable
Diferencias en diferencias Compara el cambio de los participantes con el de un grupo parecido Si los dos grupos ya venían con tendencias distintas
Emparejamiento Construye un grupo de comparación estadísticamente similar Si lo que determina quién entra al programa no se observa
Regresión discontinua Compara a quienes quedaron justo por encima y por debajo de un corte Si no hay un umbral real de elegibilidad
Antes–después Mide el cambio del grupo en el tiempo Siempre que se quiera afirmar causalidad: no la sostiene

Gertler, Martinez, Premand, Rawlings & Vermeersch (2016), Impact Evaluation in Practice, 2ª ed., Banco Mundial · BID

Cualitativos

Método Qué pregunta responde Cuándo NO usarlo
Entrevista en profundidad ¿Qué significó esto para esta persona? Cuando se necesita magnitud o cobertura
Grupo focal ¿Qué se dice colectivamente, y qué no se dice? Con temas sensibles o con jerarquías en la sala
Observación ¿Qué pasa de verdad, más allá de lo que se declara? Cuando la presencia del observador altera el hecho
Estudio de caso ¿Cómo funcionó el mecanismo en este contexto? Para generalizar a toda la población
Outcome harvesting ¿Qué cambió que no habíamos previsto? Cuando ya se sabe exactamente qué se busca
Most Significant Change De todo lo que cambió, ¿qué considera la gente lo más importante? Cuando no hay tiempo: exige varias rondas de selección

Wilson-Grau & Britt (2012, rev. 2013), Outcome Harvesting · Davies & Dart (2005), The MSC Technique: A Guide to Its Use, v1.00

Mixtos: no es usar los dos, es que uno explique al otro

Diseño Cómo se arma Para qué sirve
Convergente Cuantitativo y cualitativo a la vez, se comparan los resultados Contrastar si ambas fuentes cuentan la misma historia
Explicativo secuencial Primero los números, luego se va a buscar por qué Cuando el dato muestra algo raro y no se sabe la causa
Exploratorio secuencial Primero lo cualitativo, y con eso se construye el instrumento Cuando no se sabe todavía qué preguntar ni cómo

Un diseño mixto no es poner una cita de beneficiario al final del informe de cifras. Es que una fuente cambie lo que se le pregunta a la otra.

Creswell & Plano Clark (2018), Designing and Conducting Mixed Methods Research, 3ª ed., SAGE

3 · Métodos cualitativos, de cerca

Cosecha de resultados · Outcome Harvesting

Los demás métodos parten de los objetivos y van a ver si se cumplieron. La cosecha parte de lo que ya ocurrió y va hacia atrás a preguntar si el programa tuvo algo que ver.

Qué produce Enunciados de resultado: quién cambió qué, cuándo y dónde, y cómo se relaciona con el programa
Qué lo hace riguroso La verificación con fuentes independientes: alguien que no sea el programa confirma que eso pasó
Cuándo usarlo Programas abiertos, con muchos actores, o cuando no se sabe de antemano qué buscar
Cuándo NO Cuando la pregunta es de magnitud, o cuando ya se sabe exactamente qué se quiere medir

Wilson-Grau & Britt (2012, rev. noviembre 2013), Outcome Harvesting, Ford Foundation MENA Office

Most Significant Change

No pregunta si el cambio ocurrió. Pregunta cuál de todos los cambios importa más — y deja que sean los propios participantes quienes lo decidan.

Qué produce Relatos de cambio significativo, seleccionados en rondas sucesivas por distintos niveles de la organización
Dónde está el valor No en el relato ganador, sino en la discusión sobre por qué ese y no otro: ahí se hace explícito qué valora cada quien
Cuándo usarlo Cuando importa el criterio de valor de la gente, no solo el del programa
Cuándo NO Cuando no hay tiempo: exige varias rondas y varios niveles de selección

Davies & Dart (2005), The ‘Most Significant Change’ (MSC) Technique: A Guide to Its Use, v1.00

Los dos, uno al lado del otro

Cosecha de resultados Most Significant Change
Pregunta ¿Qué cambió que no habíamos previsto? ¿Cuál de los cambios importa más?
Quién decide qué vale El evaluador, con verificación externa Los participantes, en rondas de selección
Se elige cuando No se sabe qué buscar Sí se sabe, pero no qué priorizar
Su riesgo Quedarse en anécdota sin verificar Volverse un concurso de historias bonitas

Otros tres que vale la pena conocer

Método Qué hace Cuándo sirve
Análisis de contribución Construye y pone a prueba la historia causal del programa, y examina si explicaciones alternativas la superan Cuando no hay grupo de comparación posible pero sí una teoría de cambio declarada
Estudio de caso Reconstruye en profundidad cómo funcionó el mecanismo en un contexto concreto Cuando interesa el cómo y el en qué condiciones, no el promedio
Sistematización de experiencias Ordena e interpreta la propia práctica con quienes la vivieron, para extraer aprendizajes Cuando el equipo acumuló experiencia y no la ha convertido en conocimiento

Y los participativos —cartografía social, fotovoz, líneas de tiempo colectivas— que no solo recogen información: cambian quién tiene voz en la evaluación.

Mayne (2008), Contribution Analysis: An Approach to Exploring Cause and Effect, ILAC Brief 16 · Jara Holliday, La sistematización de experiencias: práctica y teoría para otros mundos posibles, CINDE–CEAAL

Los retos de lo cualitativo, y cómo se enfrentan

El reto Cómo se enfrenta
“Esto son solo anécdotas” — no convence a quien decide Verificar con fuentes independientes y triangular: el mismo hecho, contado por tres actores distintos
Sesgo del entrevistador y deseabilidad social — la gente dice lo que cree que uno quiere oír Que entreviste alguien que no sea responsable del programa. Preguntar por hechos antes que por opiniones
Volumen y tiempo de análisis Muestreo intencional, no maximizar el número. Se para cuando deja de aparecer información nueva
Generalización indebida Declarar el alcance: “esto ocurrió aquí, en estas condiciones” — y no más
Riesgo ético de exponer a la persona Consentimiento informado, anonimización y devolución: nadie entrega su relato para no volver a saber de él

Una advertencia sobre la IA en el análisis cualitativo

Un modelo de lenguaje
suaviza lo atípico.
Y en una cosecha de resultados, lo atípico es exactamente lo que se busca.

Sirve para ordenar volumen: transcribir, agrupar, encontrar repeticiones. Cuesta caro cuando se le pide el hallazgo: lo que aparece una sola vez es lo que tiende a borrar.

¿Cómo se valida un resultado cualitativo?

Criterio Qué pregunta Cómo se consigue
Credibilidad ¿Lo reportado corresponde a lo que las personas dijeron y vivieron? Triangulación · devolución a los participantes · permanencia prolongada en campo
Transferibilidad ¿Este hallazgo puede decir algo en otro contexto? Descripción densa del contexto: que quien lee juzgue si se parece al suyo
Dependabilidad ¿Otra persona, con los mismos datos, llegaría a algo parecido? Registro auditable de las decisiones de análisis
Confirmabilidad ¿El hallazgo viene de los datos o de las expectativas del evaluador? Trazabilidad del dato al enunciado · revisión entre pares

La verificación de la cosecha de resultados es exactamente esto: credibilidad puesta a operar.

Lincoln & Guba (1985), Naturalistic Inquiry, Sage — criterios de trustworthiness

4 · Comunicar

Las cinco secciones de un reporte orientado a decisión

# Sección La prueba de que está bien escrita
1 La decisión que este reporte informa Es una oración, no un resumen del programa
2 Lo que sabemos Son los indicadores que sí tienen dato
3 Lo que no sabíamos que estaba pasando Es el resultado cosechado hoy
4 El supuesto que pusimos a prueba Nombra el supuesto frágil de la Ficha 2
5 Recomendación Nombra una decisión concreta y quién la toma

Tres reglas para no engañar al que lee

Lo que no se sabe, se escribe

“SIN DATO” en el reporte vale más que una estimación cómoda. Quien lee necesita saber qué está firme y qué no.

Contribución, no logro

Se reporta aquello a lo que contribuimos. Escribir “logramos” donde solo contribuimos es la forma más común de mentir sin decir una falsedad.

Lo negativo también se reporta

Un reporte donde todo salió bien no es un buen reporte: es un reporte incompleto o un programa que no se miró de verdad.

Otras formas de contar lo que se hizo

Formato Qué es Cuándo sirve
1 : 3 : 25 Una página de mensajes clave, tres de resumen ejecutivo, veinticinco de informe completo Cuando hay públicos distintos y ninguno lee el documento del otro
Fiesta de datos (data party) Se llevan los datos sin conclusiones y los actores los interpretan en sesión Cuando se quiere que quien decide se apropie del hallazgo
Narrativa de datos Un solo mensaje, un gráfico que lo sostiene, y una historia con tensión y desenlace Cuando hay que mover a alguien a actuar, no solo informarle
Visual y audiovisual Infografía, video de dos minutos, fotovoz Cuando el público no lee informes, o cuando la voz de la gente es el hallazgo
Tablero vivo Los indicadores actualizados y disponibles para consulta permanente Para monitoreo continuo — no reemplaza el reporte de decisión

1:3:25 — Canadian Health Services Research Foundation, vía BetterEvaluation · Narrativa de datos — Knaflic (2015), Storytelling with Data, Wiley

Metodologías innovadoras para comunicar

Contradatos · Colombia

Dispositivos físicos e interactivos que interrumpen el espacio público y detonan conversaciones cara a cara, en vez de encuestas digitales.

El dato no entrega la respuesta: abre la pregunta.

Su principio de la deriva: quedarse atento al hallazgo inesperado que aparece en la interacción, y dejar que reformule la pregunta inicial.

Asistidas por IA

Sirve para traducir un mismo hallazgo a públicos distintos: la página de mensajes clave, el resumen ejecutivo, el texto para el boletín.

También para proponer visualizaciones alternativas y bajar el lenguaje técnico.

El límite: redacta, no decide el mensaje — y sigue suavizando lo atípico.

Contradatos — iniciativa de María Armenta y Mateo Acosta, difundida por Escuela de Datos

5 · Cierre del curso

Cierre de curso: qué nos llevamos y qué se puede ajustar para futuras experiencias

Qué nos llevamos

Una idea que se pueda usar el lunes.

Algo que hacíamos y que ya no haríamos igual.

La pregunta que quedó abierta y con la que nos vamos.

Qué se puede ajustar

Qué sobró y qué faltó en estas ocho sesiones.

Qué habría necesitado más tiempo.

Qué le dirían a un equipo que vaya a tomar este curso el año entrante.

¡Gracias por la participación
y el compromiso!