Unidad 2

Estadística Básica e Introducción a Métodos Cuantitativos y Cualitativos

Gestión de la Información y Gobernanza de Datos

Especialización en Gobierno y Gestión Pública Territorial — EAFIT

2026-01-01

Agenda de hoy

  1. ¿Qué es un dato? Tipos de variables
  2. Estadística descriptiva: las herramientas básicas
  3. Análisis gráfico: contar historias con números
  4. Correlación vs. causalidad
  5. Introducción a métodos cualitativos

Parte 1: Los Bloques de Construcción

¿Qué es un dato?

Un dato es una representación simbólica de una característica de la realidad.

Ejemplo: “El municipio de Rionegro tiene 131,000 habitantes (2024).”

  • Dato: 131,000
  • Variable: Población total
  • Unidad de observación: Municipio
  • Periodo: 2024

Tipos de variables

Cuantitativas

Expresan cantidades numéricas.

  • Continuas: Pueden tomar cualquier valor
    • Ingreso per cápita: $1,234,567
    • Tasa de desempleo: 8.7%
  • Discretas: Solo valores enteros
    • Número de escuelas: 15
    • Número de homicidios: 3

Cualitativas

Expresan categorías o atributos.

  • Nominales: Sin orden
    • Departamento: Antioquia
    • Sector: Educación
  • Ordinales: Con orden
    • Categoría municipal: 1, 2, 3, 4, 5, 6
    • Nivel de satisfacción: Alto, Medio, Bajo

Por tipo de medición:

Tipo Ejemplo municipal
Cuantitativa continua Tasa de pobreza (0–100%)
Cuantitativa discreta N° de homicidios
Cualitativa ordinal Categoría municipal (1–6)
Cualitativa nominal Departamento, región

Por comportamiento en el tiempo:

Tipo Ejemplo
Stock Población total hoy
Flujo Nacimientos en 2023
Tasa Crecimiento anual %
Índice IPM, IDH, NBI

Regla práctica

Un stock se mide en un momento. Un flujo se mide en un período.

Población vs. Muestra

Población (N)

Todos los elementos que nos interesan.

“Todos los 1,102 municipios de Colombia”

“Todos los estudiantes de grado 11 del municipio”

Muestra (n)

Un subconjunto representativo.

“200 municipios seleccionados aleatoriamente”

“50 estudiantes encuestados”

Cuidado

Cuando usas datos de TerriData para tu municipio, generalmente estás viendo datos poblacionales, no muestrales. Pero cuando lees una encuesta del DANE (como la Gran Encuesta Integrada de Hogares), estás viendo datos muestrales con margen de error.

Flujos vs. Stocks

Concepto Stock Flujo
Definición Se mide en un momento del tiempo Se mide durante un periodo
Ejemplo 1 Población total (1 de enero 2024) Nacimientos en 2024
Ejemplo 2 Deuda pública (dic 31, 2024) Ingresos tributarios del año 2024
Ejemplo 3 Número de estudiantes matriculados Tasa de deserción escolar anual

Error común: Comparar un stock con un flujo sin darse cuenta.

Tasas de crecimiento

\[\text{Tasa de crecimiento} = \frac{X_t - X_{t-1}}{X_{t-1}} \times 100\]

Ejemplo: - Población 2023: 50,000 - Población 2024: 51,500

\[\text{Tasa} = \frac{51{,}500 - 50{,}000}{50{,}000} \times 100 = 3\%\]

Errores comunes

  • Confundir puntos porcentuales con porcentaje: Si el desempleo pasa de 10% a 12%, subió 2 puntos porcentuales (no 2%).
  • La tasa de crecimiento fue del 20% (= (12-10)/10 × 100).

Parte 2: Estadística Descriptiva

Las tres preguntas de la estadística descriptiva

  1. ¿Dónde está el centro? → Media, mediana, moda
  2. ¿Qué tan dispersos están los datos? → Varianza, desviación estándar, rango
  3. ¿Hay algo raro? → Valores atípicos

Media (Promedio)

\[\bar{X} = \frac{\sum_{i=1}^{n} X_i}{n}\]

Ejemplo: Ingreso mensual de 5 familias: $800K, $900K, $1M, $1.1M, $5M

\[\bar{X} = \frac{800 + 900 + 1000 + 1100 + 5000}{5} = \$1{,}760K\]

Problema: ¿Es $1,760K un buen resumen de este grupo? Una familia con $5M distorsiona todo.

Mediana

El valor que divide los datos ordenados exactamente a la mitad.

Mismo ejemplo: $800K, $900K, $1,000K, $1,100K, $5,000K

  • Mediana = $1,000K
  • Media = $1,760K

Regla práctica

Cuando la media y la mediana son muy diferentes, hay valores atípicos o la distribución es asimétrica. En datos de ingreso o riqueza, la mediana suele ser más informativa que la media.

Media vs. Mediana: por qué importa la diferencia

Moda

El valor que más se repite.

Ejemplo: Calificaciones en una encuesta de satisfacción: 3, 4, 4, 4, 5, 5, 3, 4, 2, 4

Moda = 4 (aparece 5 veces)

La moda es especialmente útil para variables cualitativas ordinales.

Varianza y desviación estándar

\[\sigma^2 = \frac{\sum_{i=1}^{n}(X_i - \bar{X})^2}{n}\]

\[\sigma = \sqrt{\sigma^2}\]

En español: ¿Qué tan lejos están los datos del promedio, en promedio?

Desviación baja: Datos concentrados cerca del promedio.

“La mayoría de los municipios tiene entre 8% y 12% de desempleo”

Desviación alta: Datos dispersos.

“Hay municipios con 3% y otros con 25% de desempleo”

Valores atípicos (outliers)

Observaciones que se alejan significativamente del resto.

¿Por qué importan?

  • Pueden distorsionar promedios
  • Pueden ser errores de medición (dato mal reportado)
  • Pueden ser señales importantes (un municipio que tiene resultados extremadamente buenos o malos)

Regla práctica: Un valor es atípico si está a más de 1.5 veces el rango intercuartílico por encima de Q3 o por debajo de Q1.

Errores comunes en el análisis estadístico

  1. Usar solo el promedio sin reportar dispersión
  2. Ignorar el tamaño de la muestra (promedios con n=3 no son confiables)
  3. Comparar magnitudes absolutas sin normalizar (más crímenes puede significar más reporte, no más crimen)
  4. Confundir correlación con causalidad (lo veremos más adelante)
  5. No revisar los datos crudos antes de calcular (basura entra, basura sale)

Parte 3: Análisis Gráfico

¿Por qué graficar?

“El propósito de la visualización es la comprensión, no las imágenes.” — Ben Shneiderman

Un buen gráfico:

  • Comunica un hallazgo en segundos
  • Revela patrones que los números solos no muestran
  • Facilita la toma de decisiones

Un mal gráfico:

  • Confunde, engaña o aburre

¿Qué gráfico usar? Guía rápida

Histograma

Para qué sirve: Mostrar la distribución de UNA variable continua.

Ejemplo: Distribución del índice de pobreza multidimensional en los municipios de Antioquia.

  • Eje X: Rango del IPM (0-100%)
  • Eje Y: Número de municipios

Buenas prácticas:

  • Elegir un número razonable de barras (8-15)
  • Etiquetar los ejes
  • Incluir el promedio y la mediana como líneas de referencia

Gráfico de dispersión (scatter plot)

Para qué sirve: Explorar la relación entre DOS variables continuas.

Ejemplo: ¿Existe relación entre inversión en educación per cápita y resultados en Saber 11?

  • Eje X: Inversión per cápita en educación
  • Eje Y: Puntaje promedio Saber 11
  • Cada punto = un municipio

Buenas prácticas:

  • Agregar línea de tendencia (con precaución)
  • No sobrecargar (si hay 1,000 puntos, usar transparencia)
  • Etiquetar puntos clave (tu municipio, el promedio departamental)

Serie temporal (línea de tiempo)

Para qué sirve: Mostrar la evolución de una variable en el TIEMPO.

Ejemplo: Evolución de la tasa de homicidios en tu municipio (2015-2024).

  • Eje X: Año
  • Eje Y: Tasa por 100,000 habitantes

Buenas prácticas:

  • NO empezar el eje Y en un valor diferente a 0 (a menos que lo justifiques)
  • Incluir líneas de referencia (promedio nacional, departamental)
  • Si comparas múltiples series, usar colores distintos con leyenda clara

La galería de los horrores gráficos

Errores que debes evitar

  1. Pie chart con 15 categorías → Ilegible. Usa barras.
  2. Eje Y truncado → Exagera diferencias pequeñas. Si lo truncas, dilo explícitamente.
  3. 3D en gráficos → Distorsiona proporciones. Siempre 2D.
  4. Sin etiquetas de ejes → El lector no sabe qué está viendo.
  5. Colores sin contraste → Inaccesible para daltónicos (~8% de hombres).
  6. Doble eje Y → Casi siempre confunde más de lo que aclara.

Parte 4: Correlación vs. Causalidad

Datos reales: ¿qué nos dice el IPM?

IPM por municipio, 2015–2023 — Fuente: TerriData/DANE

Para reflexionar

¿Qué pasó con el IPM en 2020? ¿Qué explicaría ese cambio? ¿Cuál municipio tiene la mayor brecha frente al promedio nacional (~36%)?

Correlación vs. Causalidad

Correlación: dos variables se mueven juntas.

Causalidad: una variable produce cambios en la otra.

flowchart LR
    A["🍦 Ventas\nde helado"] -- "correlación" --> B["🔥 Muertes por\nahogamiento"]
    C["☀️ Calor\nestival"] --> A
    C --> B
    style C fill:#F7941D,color:#fff,stroke:#F7941D
    style A fill:#0047BB,color:#fff,stroke:#0047BB
    style B fill:#ef4444,color:#fff,stroke:#ef4444

La causa real es la tercera variable

El calor causa que la gente compre helado Y que la gente nade. El helado NO causa ahogamientos.

En políticas públicas: más policías ↔︎ más crimen reportado. ¿La causa es la presencia policial o el registro?

Correlación — detalles

Dos variables están correlacionadas cuando se mueven juntas (en la misma dirección o en dirección opuesta).

  • Correlación positiva: Cuando una sube, la otra también (educación e ingreso)
  • Correlación negativa: Cuando una sube, la otra baja (pobreza y esperanza de vida)
  • Sin correlación: No hay patrón

Causalidad

X causa Y si cambiar X produce un cambio en Y, manteniendo todo lo demás constante.

La pregunta clave: ¿Cambiar X realmente cambiaría Y, o hay algo más detrás?

El ejemplo clásico

Correlación observada:

“Los municipios con más policías tienen más crimen.”

¿Los policías causan crimen?

Explicación:

Los municipios con más crimen reciben más policías.

La causalidad va al revés.

O hay un tercer factor: tamaño del municipio.

3 trampas de la correlación

  1. Causalidad inversa: Y causa X (más crimen → más policías)
  2. Variable omitida: Z causa tanto X como Y (el tamaño de la ciudad)
  3. Correlación espuria: Pura coincidencia

Correlación espuria famosa

El consumo de helado y los ahogamientos están altamente correlacionados. ¿El helado causa ahogamientos? No — ambos aumentan en verano (variable omitida: temperatura).

¿Cómo establecer causalidad?

Método ¿Establece causalidad? Ejemplo
Correlación simple No “Municipios con más escuelas tienen menos pobreza”
Regresión (controlando variables) Parcialmente “Controlando por población y ubicación…”
Diferencias en diferencias Sí (con supuestos) Comparar antes/después con grupo de control
Experimento aleatorizado (RCT) Sí Asignar aleatoriamente un programa

Para este curso: Necesitas saber que correlación ≠ causalidad. El análisis causal riguroso es tema de cursos avanzados.

Parte 5: Métodos Cualitativos

¿Por qué métodos cualitativos?

Los datos cuantitativos te dicen qué pasa y cuánto.

Los datos cualitativos te dicen por qué y cómo.

Ejemplo:

  • Cuantitativo: “La deserción escolar es del 8%”
  • Cualitativo: “Los jóvenes abandonan la escuela porque necesitan trabajar para ayudar en casa, y el transporte al colegio es inseguro”

Grupos focales

Reunión de 6-12 personas para discutir un tema guiado por un moderador.

Útil para:

  • Entender percepciones y actitudes
  • Explorar temas complejos
  • Generar ideas para políticas

Tips:

  • Grupo homogéneo (no mezclar jefes con subordinados)
  • Preguntas abiertas, no cerradas
  • Grabar (con consentimiento)
  • Un moderador + un observador/tomador de notas

Entrevistas semiestructuradas

Conversación guiada con preguntas predefinidas pero flexibilidad para profundizar.

Útil para:

  • Temas sensibles
  • Perspectivas de actores clave (alcalde, secretarios, líderes comunitarios)
  • Profundizar en hallazgos cuantitativos

Tips:

  • Preparar guía de entrevista (no leerla como cuestionario)
  • Escuchar más que hablar
  • Consentimiento informado siempre
  • Triangular con datos cuantitativos

Cuanti + Cuali = Métodos Mixtos

flowchart LR
    A[Datos cuantitativos] -->|"¿Qué pasa?"| C[Hallazgo integrado]
    B[Datos cualitativos] -->|"¿Por qué?"| C
    C --> D[Mejor política pública]

Las mejores políticas públicas se diseñan con ambos tipos de evidencia.

Demo en vivo: TerriData → Excel en 5 pasos

Paso 1 — Entrar a TerriData

→ terridata.dnp.gov.co → Buscar el municipio en el buscador

Paso 2 — Seleccionar indicadores

→ Elegir tema: Educación / Salud / Pobreza → Seleccionar los años disponibles → Clic en Descargar datos (Excel o CSV)

Paso 3 — Abrir y limpiar en Excel

→ Revisar: ¿una fila = una observación? → Eliminar filas de totales intermedios → Verificar formatos de año y números

Paso 4 — Calcular estadísticas

=PROMEDIO(rango)
=MEDIANA(rango)
=DESVEST(rango)
=MAX(rango) - MIN(rango)

Paso 5 — Construir el primer gráfico

→ Seleccionar datos + año → Insertar → Gráfico de líneas → Agregar título y fuente

Pregunta clave

¿El promedio y la mediana son muy distintos? Si sí → hay valores atípicos importantes.

El ejemplo del crimen y el reporte

Lo que muestran los datos

Un municipio instala un sistema de reporte de crímenes más fácil.

Al año siguiente:

↑ Denuncias de hurto: +38%

El periódico titula: “Aumenta la inseguridad”

Lo que realmente pasó

flowchart TD
    A["Nuevo sistema\nde reporte"] --> B["Más denuncias\n(dato)"]
    C["Crimen real"] -.->|"no cambia"| B
    B --> D["Titular: Aumentó\nla inseguridad"]
    style A fill:#0047BB,color:#fff,stroke:#0047BB
    style C fill:#1B6B4E,color:#fff,stroke:#1B6B4E
    style D fill:#ef4444,color:#fff,stroke:#ef4444
    style B fill:#f59e0b,color:#fff,stroke:#f59e0b

Lo que cambió: la medición, no la realidad.

Lección: Correlación ≠ Causalidad. Lo que sube puede ser el reporte, no el fenómeno.

Tu Actividad

Actividad 2: “Radiografía estadística de mi municipio”

Entregable: Infografía (1 pág) + memo analítico (máx 2 págs)

Tu tarea:

  1. Descarga datos de tu municipio desde TerriData
  2. Selecciona 5+ indicadores de diferentes dimensiones
  3. Calcula: media, mediana, desviación estándar
  4. Crea 3 gráficos: histograma, serie temporal, dispersión
  5. Identifica 1 correlación y argumenta por qué NO es causal
  6. Diseña la infografía + escribe el memo

Resumen de la Unidad 2

Ideas clave

  • Los tipos de variables determinan qué análisis puedes hacer
  • La media, mediana y moda cuentan historias diferentes
  • La desviación estándar te dice qué tan “típico” es el promedio
  • Los gráficos deben ser claros, honestos y etiquetados
  • Correlación ≠ Causalidad — la lección más importante del curso
  • Los métodos cualitativos complementan lo cuantitativo

Próxima unidad: Fuentes de información — ¿dónde están los datos que necesitas?

Referencias

  • Wackerly, D., Mendenhall, W. & Scheaffer, R. (2010). Estadística Matemática con Aplicaciones. Cap. 1.
  • Lora, E. & Prada, S. Técnicas de Medición Económica. 6a ed. ICESI.
  • Bonilla-Castro, E. & Rodríguez S., P. (2013). Más Allá del Dilema de los Métodos. Uniandes.
  • Morales-Vallejo, P. (2008). Estadística Aplicada a las Ciencias Sociales. Comillas.