Metodología de Construcción de Índices Multidimensionales (Pulso Social)
Las Antioquias: Análisis de Brechas Territoriales en Antioquia
1 Introducción
El análisis de reducción de dimensiones busca simplificar el estudio de las múltiples dimensiones del bienestar territorial en Antioquia mediante la construcción de índices sintéticos que permitan identificar las principales brechas entre los 125 municipios del departamento. Para esto, se emplean métodos de aprendizaje no supervisado que identifican, a partir de los datos, las asociaciones y patrones naturales entre variables relacionadas. En particular, se utilizan métodos de reducción de dimensiones que transforman un conjunto grande de indicadores en otro más pequeño que conserva la mayor parte de la información relevante.
Con la implementación de estos métodos se sacrifica cierta precisión al reducir dimensiones, pero se gana interpretabilidad y capacidad analítica al disponer de índices sintéticos fáciles de explorar, visualizar y comparar. Existen distintos métodos de reducción de dimensiones: Análisis de Componentes Principales (ACP/PCA), Mínimos Cuadrados Parciales (PLS), Análisis de Correspondencias y Uniform Manifold Approximation and Projection (UMAP), entre otros. Dada la naturaleza continua de los indicadores municipales y la necesidad de interpretabilidad lineal, se implementó el ACP como método principal.
2 Procedimiento de ACP en Las Antioquias
Selección de variables y preparación de datos
La infraestructura de datos consolida información de múltiples fuentes institucionales (DANE, DNP, Ministerios, Gobernación de Antioquia) con distinta disponibilidad temporal y espacial. Se construyó una base de datos que prioriza la mayor cobertura posible aplicando los siguientes criterios:Unidad de análisis: municipal. Los 125 municipios de Antioquia constituyen la unidad básica de comparación territorial.
Temporal: se utiliza la información más reciente disponible para cada indicador, privilegiando datos posteriores a 2018 cuando es posible.
Cobertura: se priorizan variables con información en ≥ 80% de los municipios del departamento.
Agrupación temática: las variables se organizan en 15 subdimensiones que corresponden a las áreas clave de contexto y resultados del ciclo de vida. Tratamiento de variables direccionales**
Previo al análisis PCA, se realiza un ajuste direccional de las variables para garantizar que todas tengan la misma interpretación: valores más altos indican mejor situación. Esto implica invertir el signo (multiplicar por -1) de aquellas variables donde valores elevados representan condiciones adversas:Ejemplos de inversión: tasas de desempleo, pobreza, mortalidad, déficit habitacional, inseguridad alimentaria, índices de riesgo, etc.
Documentación: cada variable invertida queda explícitamente documentada en el código de construcción de índices (
01_IDX.R).
Beneficio: permite que todos los componentes principales tengan interpretación consistente (mayor valor = mejor desempeño relativo).
Normalización y estandarización
Para evitar que variables con magnitudes muy diferentes dominen el análisis y garantizar que cada indicador contribuya equitativamente, se aplica un pipeline de normalización en dos etapas usandorecipes:(Etapa 1) Normalización: Se centra y escala cada variable para que tenga media 0 y desviación estándar 1. Esto elimina efectos de escala entre variables medidas en unidades diferentes (porcentajes, tasas por 100,000 hab., índices 0-100, etc.).
(Etapa 2 - Opcional) Transformación orderNorm: En algunos casos se puede aplicar la transformación de normalización por rangos, que mapea los datos a una distribución aproximadamente normal: \[ g(x) \;=\; \Phi^{-1}\!\left(\frac{\mathrm{rank}(x)-0.5}{\mathrm{length}(x)}\right) \] donde \(\Phi^{-1}\) es la función cuantil de la distribución normal estándar, \(\mathrm{rank}(x)\) es el rango de cada observación y \(\mathrm{length}(x)\) el número de observaciones (125 municipios).
Análisis de Componentes Principales (PCA)
Con los datos normalizados e imputados, se aplica PCA mediantestep_pca()detidymodels. El método descompone la varianza multidimensional siguiendo estos pasos:Matriz de covarianzas: Se construye automáticamente a partir de las variables estandarizadas, capturando todas las correlaciones bivariadas entre indicadores.
Descomposición espectral: Se calculan los autovalores (eigenvalues) y autovectores (eigenvectors) de la matriz de covarianzas. Cada autovector define la dirección de máxima varianza restante (un componente principal), y su autovalor asociado indica la cantidad de varianza explicada.
Componentes principales: Cada componente \(PC_k\) es una combinación lineal de las variables originales: \[ PC_k = w_{k1}x_1 + w_{k2}x_2 + \cdots + w_{kp}x_p \] donde \(w_{ki}\) son las cargas (loadings) que indican la contribución de cada variable \(x_i\) al componente \(k\). Los componentes son ortogonales entre sí (no correlacionados) y están ordenados por varianza explicada decreciente.
Selección del número de componentes
Para cada una de las 15 subdimensiones se conservan hasta 5 componentes principales (o menos si el número de variables es menor), garantizando así:- Poder explicativo: Los primeros componentes capturan la mayor parte de la varianza (típicamente >60-75% con 2-3 componentes).
- **Intes: 15 índices multidimensionales
- Poder explicativo: Los primeros componentes capturan la mayor parte de la varianza (típicamente >60-75% con 2-3 componentes).
Como resultado del pipeline de PCA, se construyen 15 índices temáticos (uno por subdimensión), divididos entre indicadores de contexto (11) y de resultado (4). Cada índice genera múltiples componentes principales (típicamente 2-4), resultando en un total de 31 componentes principales que alimentan el análisis posterior de clustering y brechas territoriales.
2.1 Estructura de outputs por índice
Para cada uno de los 15 índices, el proceso genera automáticamente:
- Dataset con scores PCA: valores de cada municipio en los componentes principales.
- Tabla de cargas (loadings): contribución de cada variable a cada componente.
- Estadísticas descriptivas: resúmenes de las variables originales y componentes.
- Gráficos de cargas: visualización de las variables con mayor peso en cada componente.
- Mapas temáticos: distribución espacial de los componentes principales por municipio.
- Gráficos de telaraña (radar charts): perfiles multivariados de los componentes.
2.2 Índices de contexto
Estas 11 dimensiones capturan las condiciones estructurales del territorio (infraestructura, economía, demografía, riesgos), esenciales para comprender el marco en el que se diseñan políticas públicas y se generan oportunidades para la población.
- Agua potable y saneamiento — Acceso a servicios básicos (IRCA urbano/rural, cobertura acueducto/alcantarillado)
- Desarrollo económico — Infraestructura vial, densidad empresarial, conectividad digital, inclusión financiera
- Cambio climático — Vulnerabilidad ante eventos climáticos, amenazas naturales, capacidad de adaptación
- Pobreza — Índice de Pobreza Multidimensional (IPM), NBI, líneas de pobreza, inseguridad alimentaria
- Características de la vivienda — Déficit cualitativo/cuantitativo, hacinamiento, materialidad, servicios públicos
- Capacidad fiscal — Desempeño fiscal municipal, capacidad de gestión, categorización
- Desigualdad — Coeficiente de Gini, brechas de ingreso, concentración de la riqueza
- Estructura demográfica — Pirámide poblacional, tasas de dependencia, razón de masculinidad
- Salud — Enfermedades transmitidas por vectores (dengue, malaria, leishmaniasis), infraestructura hospitalaria
- Salud mental — Tasas de suicidio e intentos, trastornos mentales, violencia
- Seguridad — Índice de Riesgo de Victimización (IRV), homicidios, delitos, violencias de género
2.3 Índices de resultado (ciclo de vida)
Estas 4 dimensiones reflejan situaciones de bienestar específicas a lo largo del ciclo de vida, capturando cómo las condiciones de contexto se traducen en resultados concretos para diferentes grupos etarios.
- Infancia y niñez — Mortalidad infantil, desnutrición, cobertura en educación inicial y primaria, repitencia
- Juventud — Fecundidad adolescente, cobertura en educación media, calidad educativa, repitencia
- Adultez — Desempleo (total y brechas género), informalidad laboral, afiliación a salud
- Vejez — Índice de envejecimiento, mortalidad por IAM, cobertura pensional
2.4 Uso de los índices en análisis posteriores
Los 31 componentes principales resultantes (agregados de las 15 subdimensiones) constituyen la base del análisis de clustering territorial (ver metodología de clustering), donde se identifican los tres grandes grupos territoriales (Consolidada, Transición, Vulnerable) y sus respectivos subclusters.
Cada componente principal tiene una interpretación sustantiva basada en las cargas (loadings) de las variables originales, documentada en las páginas individuales de cada índice. Esta interpretabilidad permite no solo clasificar territorios, sino también diagnosticar dimensiones específicas de rezago o fortaleza en cada municipio.os_idx1_servicio.html) - Crecimiento económico - Cambio climático - Pobreza - Características de la vivienda - Capacidad fiscal - Desigualdad - Estructura demográfica - Salud - Salud Mental - Seguridad
- Resultados: situaciones sociales específicas a lo largo del ciclo de vida; reflejan el contexto e impactos en bienestar.