Las Antioquias - Metodología

1 Introducción

Una vez construida una aproximación simple para cada una de las subdimensiones, se realizó el último paso del análisis: identificar las realidades territoriales a partir del análisis sistemático de la información disponible. Para esto, se aplicó un método de aprendizaje no supervisado para dividir las observaciones en grupos que cumplan los siguientes principios (Anderson 2003):

  • Principio de cohesión: cada grupo debe ser homogéneo internamente en las variables utilizadas. En el presente proyecto, se busca que las regiones o departamentos sean altamente parecidos en las 13 dimensiones de la metodología Pulso Social.
  • Principio de separación: se debe garantizar que las diferencias entre grupos estén claramente definidas, es decir, que cada grupo presente condiciones que lo distingan de los demás.

En el marco de Pulso Social, el análisis de conglomerados ofrece una lectura de las brechas territoriales en Antioquia a partir de un análisis sistemático de las dimensiones que componen la metodología. A continuación, se presentan estadísticas descriptivas de los índices empleados en el análisis (resultado del ACP).

1.1 Estadísticas descriptivas de los índices

Código
library(readxl)
library(knitr)
library(magrittr)
ruta_excel <- "all/04_Cluster/Summary_Stats.xlsx"
tabla_resumen <- read_xlsx(ruta_excel)
tabla_resumen %>%
  dplyr::select(Etiqueta, N, Media, SD, Min, Max) %>%
  dplyr::mutate(Media = round(Media, 3), SD = round(SD, 3), Min = round(Min, 3), Max = round(Max, 3)) %>%
  kable(caption = "Resumen de variables numéricas válidas")
Resumen de variables numéricas válidas
Etiqueta N Media SD Min Max
Acceso a servicio de agua potable y saneamiento - 1 125 0 1 -8.737 0.570
Adultez - 1 125 0 1 -1.793 3.275
Adultez - 2 125 0 1 -2.568 2.339
Adultez - 3 125 0 1 -2.676 2.989
Cambio climatico - 1 125 0 1 -3.378 2.718
Cambio climatico - 2 125 0 1 -3.250 2.803
Capacidad fiscal - 1 125 0 1 -3.471 4.172
Capacidad fiscal - 2 125 0 1 -1.335 10.156
Características de las viviendas - 1 125 0 1 -4.217 1.415
Características de las viviendas - 2 125 0 1 -2.688 3.149
Desarrollo económico - 1 125 0 1 -1.956 3.968
Desarrollo económico - 2 125 0 1 -2.529 3.362
Desarrollo económico - 3 125 0 1 -1.852 5.872
Desigualdad - 1 125 0 1 -1.766 3.081
Estructura demográfica - 1 125 0 1 -3.484 2.346
Infancia y Niñez - 1 125 0 1 -2.456 4.665
Infancia y Niñez - 2 125 0 1 -2.799 2.913
Infancia y Niñez - 3 125 0 1 -5.091 2.507
Infancia y Niñez - 4 125 0 1 -3.537 2.782
Juventud - 1 125 0 1 -3.812 2.828
Juventud - 2 125 0 1 -4.055 2.177
Juventud - 3 125 0 1 -2.359 2.861
Juventud - 4 125 0 1 -3.379 2.811
Pobreza - 1 125 0 1 -2.961 1.857
Pobreza - 2 125 0 1 -2.055 2.461
Salud - 1 125 0 1 -5.537 0.674
Salud - 2 125 0 1 -3.896 3.474
Salud mental - 1 125 0 1 -1.898 3.402
Salud mental - 2 125 0 1 -3.607 2.347
Seguridad - 1 125 0 1 -3.955 1.525
Seguridad - 2 125 0 1 -1.590 3.057
Vejez - 1 125 0 1 -2.717 1.771

2 Matriz de distancia o disimilitud

El primer paso del análisis de conglomerados es la estimación de la matriz de distancia/disimilitud, que establece una medida de (dis)similitud entre cada par de observaciones. Existen varios métodos para estimarla; dado que se observaron resultados similares entre alternativas, se eligió el método euclidiano1:

\[ d_{\mathrm{ecu}}(x,y)\;=\;\sqrt{\sum_{i=1}^{n} \bigl(x_i - y_i\bigr)^2}\,. \]

La siguiente figura presenta los resultados de la aplicación de la matriz de distancia. Se sugieren varios grupos de departamentos con condiciones similares. Por ejemplo, Antioquia, Valle del Cauca, Risaralda, Caldas y Quindío muestran alta similitud; en contraste, Vaupés, La Guajira, entre otros, difieren de los anteriores pero son similares entre ellos. Esta es la primera aproximación a los posibles clusters que surgirán del análisis.

Matriz de distancia euclídea

3 Método jerárquico aglomerativo (AGNES)

El método de conglomerados utilizado fue el jerárquico aglomerativo, también conocido como AGNES (Agglomerative Nesting). La lógica es la siguiente: cada objeto inicia como un clúster de un solo elemento; de forma iterada, se van combinando en clústeres mayores hasta que todas las observaciones pertenecen a una única raíz (Anderson 2003). Esta lógica permite una representación visual conocida como dendrograma.

3.1 Selección del método de enlace

Dado que existen distintos criterios de enlace (linkage), se realizó una comparación mediante el coeficiente de aglomeración, que indica el poder de explicación de la estructura de agrupación para un enlace dado. Cuanto más cercano a 1, mejor la agrupación (Anderson 2003).

Resultados:

average single complete ward
0.64 0.62 0.72 0.84

Conclusión: el enlace Ward es el más apropiado en este caso.

3.2 Determinación del número de clústeres (k)

Tras elegir el enlace, se determina el número óptimo de clústeres. Aunque no existe un criterio único, el más usado es el método del codo (elbow), que busca el (k) que minimiza la variación intra–clúster (WSS):

\[ \arg\min_{k}\ \sum_{j=1}^{k} W(C_j)\,, \]

donde (C_j) es el clúster (j)-ésimo y (W(C_j)) su variación intra. La WSS mide la compacidad de la agrupación; se desea que sea lo más pequeña posible. Los resultados se muestran a continuación.

Método del codo para estimar k óptimo

A partir de la evidencia y la discusión técnica, se concluye que el número óptimo de clústeres es tres (3).

3.3 Dendrograma y representación de clústeres

Una vez definido el enlace y (k) óptimo, se presenta la salida gráfica del análisis.

Dendrograma (AGNES) Dendrograma con variables

4 Composición de los clústeres

  • Clúster 1 – Antioquia consolidada
  • Clúster 2 – Antioquia en transición
  • Clúster 3 – Antioquia vulnerable

La representación espacial de los clústeres se ilustra a continuación.

Mapa de clústeres: Las Antioquias

5 Contribución de las variables

Finalmente, se presenta la composición/media de las variables por tipo de clúster. El análisis detallado se desarrolla en el informe técnico.

Medias de indicadores de contexto (1) por clúster

Medias de indicadores de contexto (2) por clúster

Medias de indicadores de resultado por clúster

Referencias

Anderson, T W. 2003. An Introduction to Multivariate Statistical Analysis. https://doi.org/10.2307/2343317.

Notas

  1. Entre los métodos alternativos para la matriz de distancia: Manhattan, correlación de Pearson, entre otros.↩︎