NGRDI-DCNLab: Integrando Prior Espectral y Convolución Deformable para la Extracción de Espacios Verdes Urbanos a partir de Imágenes de Teledetección RGB de Alta Resolución
Autores: Lin, Baoye; Du, Xiaofeng; Man, Wang; Song, Zigeng; Ren, Zhoupeng; Nie, Qin; Li, Zongmei; Zhang, Xinchang
Idioma: Inglés
Editor: MDPI
Año: 2026
Acceso abierto
Artículo científico
Categoría
Ciencias Medioambientales
Subcategoría
Ciencias medioambientales generales
Palabras clave
Espacio verde urbano
Imágenes RGB
Aprendizaje profundo
Modelo NGRDI-DCNLab
índice de vegetación
Separabilidad espectral
Licencia
CC BY-SA – Atribución – Compartir Igual
Consultas: 7
Citaciones: Sin citaciones
El mapeo preciso de espacios verdes urbanos (UGS) es esencial para evaluar la salud de los ecosistemas urbanos y apoyar la planificación del desarrollo sostenible. Sin embargo, la segmentación de UGS basada en aprendizaje profundo a partir de imágenes de teledetección en Red-Verde-Azul (RGB) enfrenta dos desafíos principales. Primero, la ausencia de información en el infrarrojo cercano (NIR) en las imágenes RGB dificulta la capacidad de discriminar clases espectralmente similares, como la vegetación y la no vegetación. Segundo, las convoluciones convencionales con campos receptivos fijos tienen dificultades para modelar los límites complejos e irregulares característicos de los UGS. Para abordar estos desafíos, este estudio combinó el Índice de Diferencia Normalizada Verde-Rojo con el modelo de Red Neuronal Convolucional Deformable (NGRDI-DCNLab), un modelo de segmentación semántica diseñado específicamente para imágenes solo RGB. Basado en el marco DeepLabV3+, el modelo introdujo tres mejoras clave: (1) Se incorporó el Índice de Diferencia Normalizada Verde-Rojo (NGRDI) para compensar la ausencia de información NIR, mejorando la separabilidad espectral de los píxeles de vegetación. (2) Las convoluciones estándar en el decodificador fueron reemplazadas por convoluciones deformables, lo que permite a la red adaptarse de manera más efectiva a los límites irregulares de los UGS. (3) Se diseñó una función de pérdida ponderada por NGRDI para asignar mayores pesos a muestras desafiantes y regiones de límites inciertos, guiando al modelo hacia una delineación de bordes más precisa. Evaluaciones exhaustivas en dos conjuntos de datos públicos de alta resolución: el Conjunto de Datos de Etiquetado Denso de Wuhan (WHDLD) y el subconjunto de Beijing del conjunto de datos de Espacio Verde Urbano-1m (UGS-1m_Beijing) demostraron que el modelo NGRDI-DCNLab superó a los modelos de aprendizaje profundo populares existentes (como Unet++, etc.). Específicamente, la convolución deformable mejora efectivamente la capacidad de modelado de características para límites irregulares; la incorporación del índice de vegetación NGRDI como un cuarto canal refuerza la representación de características espectrales y mejora la distinción entre vegetación y no vegetación; y la adición de la pérdida ponderada dinámica por NGRDI permite un aprendizaje dirigido para muestras desafiantes. A través del efecto sinérgico de estos tres módulos, el modelo logra puntuaciones de Intersección sobre Unión (MIoU) promedio del 84.77% y 77.66%, así como puntuaciones F1 del 91.75% y 87.27%, en los conjuntos de datos WHDLD y UGS-1m_Beijing, respectivamente. Además, el modelo mostró cierta capacidad de generalización en el conjunto de datos de vehículos aéreos no tripulados (UAV), el Conjunto de Datos de Drones Urbanos 6 (UDD6), alcanzando un MIoU del 87.43%. Nuestros resultados confirman que la extracción de UGS de alta precisión es alcanzable utilizando solo imágenes de teledetección RGB, proporcionando una solución técnica rentable y práctica para la gobernanza urbana refinada y el monitoreo ecológico.
Descripción
El mapeo preciso de espacios verdes urbanos (UGS) es esencial para evaluar la salud de los ecosistemas urbanos y apoyar la planificación del desarrollo sostenible. Sin embargo, la segmentación de UGS basada en aprendizaje profundo a partir de imágenes de teledetección en Red-Verde-Azul (RGB) enfrenta dos desafíos principales. Primero, la ausencia de información en el infrarrojo cercano (NIR) en las imágenes RGB dificulta la capacidad de discriminar clases espectralmente similares, como la vegetación y la no vegetación. Segundo, las convoluciones convencionales con campos receptivos fijos tienen dificultades para modelar los límites complejos e irregulares característicos de los UGS. Para abordar estos desafíos, este estudio combinó el Índice de Diferencia Normalizada Verde-Rojo con el modelo de Red Neuronal Convolucional Deformable (NGRDI-DCNLab), un modelo de segmentación semántica diseñado específicamente para imágenes solo RGB. Basado en el marco DeepLabV3+, el modelo introdujo tres mejoras clave: (1) Se incorporó el Índice de Diferencia Normalizada Verde-Rojo (NGRDI) para compensar la ausencia de información NIR, mejorando la separabilidad espectral de los píxeles de vegetación. (2) Las convoluciones estándar en el decodificador fueron reemplazadas por convoluciones deformables, lo que permite a la red adaptarse de manera más efectiva a los límites irregulares de los UGS. (3) Se diseñó una función de pérdida ponderada por NGRDI para asignar mayores pesos a muestras desafiantes y regiones de límites inciertos, guiando al modelo hacia una delineación de bordes más precisa. Evaluaciones exhaustivas en dos conjuntos de datos públicos de alta resolución: el Conjunto de Datos de Etiquetado Denso de Wuhan (WHDLD) y el subconjunto de Beijing del conjunto de datos de Espacio Verde Urbano-1m (UGS-1m_Beijing) demostraron que el modelo NGRDI-DCNLab superó a los modelos de aprendizaje profundo populares existentes (como Unet++, etc.). Específicamente, la convolución deformable mejora efectivamente la capacidad de modelado de características para límites irregulares; la incorporación del índice de vegetación NGRDI como un cuarto canal refuerza la representación de características espectrales y mejora la distinción entre vegetación y no vegetación; y la adición de la pérdida ponderada dinámica por NGRDI permite un aprendizaje dirigido para muestras desafiantes. A través del efecto sinérgico de estos tres módulos, el modelo logra puntuaciones de Intersección sobre Unión (MIoU) promedio del 84.77% y 77.66%, así como puntuaciones F1 del 91.75% y 87.27%, en los conjuntos de datos WHDLD y UGS-1m_Beijing, respectivamente. Además, el modelo mostró cierta capacidad de generalización en el conjunto de datos de vehículos aéreos no tripulados (UAV), el Conjunto de Datos de Drones Urbanos 6 (UDD6), alcanzando un MIoU del 87.43%. Nuestros resultados confirman que la extracción de UGS de alta precisión es alcanzable utilizando solo imágenes de teledetección RGB, proporcionando una solución técnica rentable y práctica para la gobernanza urbana refinada y el monitoreo ecológico.