La Antioquia Consolidada - Metodología

1 Introducción

Una vez construida una aproximación simple para cada una de las subdimensiones, se realizó el último paso del análisis: identificar las realidades territoriales a partir del análisis sistemático de la información disponible. Para esto, se aplicó un método de aprendizaje no supervisado para dividir las observaciones en grupos que cumplan los siguientes principios (Anderson 2003):

  • Principio de cohesión: cada grupo debe ser homogéneo internamente en las variables utilizadas. En el presente proyecto, se busca que las regiones o departamentos sean altamente parecidos en las 13 dimensiones de la metodología Pulso Social.
  • Principio de separación: se debe garantizar que las diferencias entre grupos estén claramente definidas, es decir, que cada grupo presente condiciones que lo distingan de los demás.

En el marco de Pulso Social, el análisis de conglomerados ofrece una lectura de las brechas territoriales en Antioquia a partir de un análisis sistemático de las dimensiones que componen la metodología. A continuación, se presentan estadísticas descriptivas de los índices empleados en el análisis (resultado del ACP).

1.1 Estadísticas descriptivas de los índices

Código
library(readxl)
library(knitr)
library(magrittr)
ruta_excel <- "Consolidada_ref_subset/04_Cluster/Summary_Stats.xlsx"
tabla_resumen <- read_xlsx(ruta_excel)
tabla_resumen %>%
  dplyr::select(Etiqueta, N, Media, SD, Min, Max) %>%
  dplyr::mutate(Media = round(Media, 3), SD = round(SD, 3), Min = round(Min, 3), Max = round(Max, 3)) %>%
  kable(caption = "Resumen de variables numéricas válidas")
Resumen de variables numéricas válidas
Etiqueta N Media SD Min Max
Acceso a servicio de agua potable y saneamiento - 1 21 0 1 -2.778 1.250
Adultez - 1 21 0 1 -1.587 1.668
Adultez - 2 21 0 1 -1.829 1.656
Adultez - 3 21 0 1 -2.357 2.068
Cambio climatico - 1 21 0 1 -1.422 2.309
Cambio climatico - 2 21 0 1 -1.844 2.150
Capacidad fiscal - 1 21 0 1 -1.679 2.899
Capacidad fiscal - 2 21 0 1 -0.498 4.309
Características de las viviendas - 1 21 0 1 -2.280 1.896
Características de las viviendas - 2 21 0 1 -1.768 1.505
Desarrollo económico - 1 21 0 1 -1.208 2.291
Desarrollo económico - 2 21 0 1 -1.582 1.807
Desarrollo económico - 3 21 0 1 -2.156 1.314
Desigualdad - 1 21 0 1 -1.556 1.480
Estructura demográfica - 1 21 0 1 -2.512 1.592
Infancia y Niñez - 1 21 0 1 -1.641 2.303
Infancia y Niñez - 2 21 0 1 -2.527 1.381
Infancia y Niñez - 3 21 0 1 -2.388 1.521
Infancia y Niñez - 4 21 0 1 -2.207 1.520
Juventud - 1 21 0 1 -1.883 2.079
Juventud - 2 21 0 1 -1.866 2.023
Juventud - 3 21 0 1 -1.840 1.948
Juventud - 4 21 0 1 -2.976 1.708
Pobreza - 1 21 0 1 -1.384 1.864
Pobreza - 2 21 0 1 -2.155 1.589
Salud - 1 21 0 1 -1.397 2.311
Salud - 2 21 0 1 -0.975 2.239
Salud mental - 1 21 0 1 -1.451 2.112
Salud mental - 2 21 0 1 -1.808 3.120
Seguridad - 1 21 0 1 -1.697 1.698
Seguridad - 2 21 0 1 -1.467 2.009
Vejez - 1 21 0 1 -1.842 1.956

2 Matriz de distancia o disimilitud

El primer paso del análisis de conglomerados es la estimación de la matriz de distancia/disimilitud, que establece una medida de (dis)similitud entre cada par de observaciones. Existen varios métodos para estimarla; dado que se observaron resultados similares entre alternativas, se eligió el método euclidiano1:

\[ d_{\mathrm{ecu}}(x,y)\;=\;\sqrt{\sum_{i=1}^{n} \bigl(x_i - y_i\bigr)^2}\,. \]

La siguiente figura presenta los resultados de la aplicación de la matriz de distancia. Se sugieren varios grupos de departamentos con condiciones similares. Por ejemplo, Antioquia, Valle del Cauca, Risaralda, Caldas y Quindío muestran alta similitud; en contraste, Vaupés, La Guajira, entre otros, difieren de los anteriores pero son similares entre ellos. Esta es la primera aproximación a los posibles clusters que surgirán del análisis.

Matriz de distancia euclídea

3 Método jerárquico aglomerativo (AGNES)

El método de conglomerados utilizado fue el jerárquico aglomerativo, también conocido como AGNES (Agglomerative Nesting). La lógica es la siguiente: cada objeto inicia como un clúster de un solo elemento; de forma iterada, se van combinando en clústeres mayores hasta que todas las observaciones pertenecen a una única raíz (Anderson 2003). Esta lógica permite una representación visual conocida como dendrograma.

3.1 Selección del método de enlace

Dado que existen distintos criterios de enlace (linkage), se realizó una comparación mediante el coeficiente de aglomeración, que indica el poder de explicación de la estructura de agrupación para un enlace dado. Cuanto más cercano a 1, mejor la agrupación (Anderson 2003).

Resultados:

average single complete ward
0.32 0.26 0.47 0.55

Conclusión: el enlace Ward es el más apropiado en este caso.

3.2 Determinación del número de clústeres (k)

Tras elegir el enlace, se determina el número óptimo de clústeres. Aunque no existe un criterio único, el más usado es el método del codo (elbow), que busca el (k) que minimiza la variación intra–clúster (WSS):

\[ \arg\min_{k}\ \sum_{j=1}^{k} W(C_j)\,, \]

donde (C_j) es el clúster (j)-ésimo y (W(C_j)) su variación intra. La WSS mide la compacidad de la agrupación; se desea que sea lo más pequeña posible. Los resultados se muestran a continuación.

Método del codo para estimar k óptimo

A partir de la evidencia y la discusión técnica, se concluye que el número óptimo de clústeres es tres (3).

3.3 Dendrograma y representación de clústeres

Una vez definido el enlace y (k) óptimo, se presenta la salida gráfica del análisis.

Dendrograma (AGNES) Dendrograma con variables

4 Composición de los clústeres

  • Clúster 1 – Antioquia Consolidada - Alta
  • Clúster 2 – Antioquia Consolidada - Media
  • Clúster 3 – Antioquia Consolidada - Baja

La representación espacial de los clústeres se ilustra a continuación.

Mapa de clústeres: Las Antioquias

5 Contribución de las variables

Finalmente, se presenta la composición/media de las variables por tipo de clúster. El análisis detallado se desarrolla en el informe técnico.

Medias de indicadores de contexto (1) por clúster

Medias de indicadores de contexto (2) por clúster

Medias de indicadores de resultado por clúster

Referencias

Anderson, T W. 2003. An Introduction to Multivariate Statistical Analysis. https://doi.org/10.2307/2343317.

Notas

  1. Entre los métodos alternativos para la matriz de distancia: Manhattan, correlación de Pearson, entre otros.↩︎