Comparación de espectrogramas para detectar soplos cardíacos anormales con CNN

Comparamos logmel, PCEN y espectrogramas multiresolución en la detección de soplos cardíacos. PCEN y multiresolución alcanzan 0.916 de precisión. Descubre cuál

sábado, 25 de julio de 2026 • 4 min de lectura • Equipo Q2BSTUDIO

¿Qué espectrograma mejora la detección de latidos anormales?

La detección temprana de anomalías cardíacas sigue siendo un desafío clínico de primer orden. Aunque los avances en imagenología son notables, la auscultación tradicional con estetoscopio sigue siendo la herramienta de cribado más accesible y barata. Sin embargo, la interpretación de sonidos cardíacos depende en gran medida de la experiencia del médico. Aquí es donde la inteligencia artificial entra en juego: transformar una simple grabación de latidos en una decisión clínica asistida por modelos de IA capaces de discernir entre sonidos normales y anómalos. En Q2BSTUDIO, empresa especializada en aplicaciones a medida, sabemos que la clave no está solo en la arquitectura de la red neuronal, sino en cómo preparamos los datos de entrada. Este artículo analiza una comparación empírica de tres representaciones espectrales —logmel, PCEN y multirresolución— aplicadas a un clasificador CNN sobre el dataset PhysioNet 2016 de sonidos cardíacos.

La metodología seguida por los investigadores fue deliberadamente simple para aislar el efecto de la representación: mantuvieron fija la CNN —misma arquitectura, mismo optimizador Adam, misma semilla aleatoria— y variaron únicamente la forma de convertir el audio en una imagen espectral. El log-mel espectrograma (logmel) es la técnica más extendida: aplica una transformada de Fourier de corta duración (STFT) con ventanas de tamaño fijo, mapea las magnitudes al espacio mel y comprime logarítmicamente. El PCEN (Per-Channel Energy Normalization) introduce una normalización temporal por banda de frecuencia que reduce el efecto de variaciones de volumen y ruido de fondo, algo común en grabaciones de estetoscopio. La versión multirresolución apila varios espectrogramas logmel generados con diferentes tamaños de ventana (por ejemplo, 25 ms, 50 ms y 100 ms) creando un tensor de tres canales que captura información tanto de eventos rápidos como de tonos sostenidos.

Los resultados del estudio revelan que las tres representaciones alcanzan una sensibilidad cercana al 0.95 en la detección de casos anómalos, lo que indica que la CNN extrae patrones relevantes en todos los casos. Sin embargo, la métrica oficial de PhysioNet —una combinación de sensibilidad y especificidad— muestra que PCEN (0.915) y multirresolución (0.916) superan ligeramente al logmel (0.910). Aunque las diferencias son pequeñas, en un contexto clínico donde cada décima de precisión puede traducirse en vidas salvadas, cualquier mejora es relevante. Además, el uso de Grad-CAM para visualizar las regiones activadas en las imágenes espectrales confirmó que el modelo se enfoca principalmente en las frecuencias bajas donde residen los sonidos S1 y S2, signo de que el aprendizaje se basa en fundamentos fisiológicos reales y no en artefactos.

Desde una perspectiva técnica, la implementación de este tipo de sistemas requiere un ecosistema robusto de cloud AWS/Azure para escalar el procesamiento de miles de grabaciones diarias, así como medidas de ciberseguridad para proteger datos sanitarios sensibles. En Q2BSTUDIO integramos pipelines completos de datos que van desde la ingesta de audio hasta el despliegue de modelos en producción, utilizando herramientas de Business Intelligence como Power BI para monitorizar el rendimiento y generar dashboards que ayuden a los equipos clínicos a interpretar las predicciones. Además, la automatización de procesos mediante agentes IA permite orquestar flujos de trabajo inteligentes que, por ejemplo, prioricen las grabaciones con alta probabilidad de anomalía para que un cardiólogo las revise de inmediato.

Otro aspecto relevante es el preprocesamiento de audio en entornos reales. El PCEN demostró ser particularmente robusto frente a ruidos ambientales, lo que lo convierte en una opción ideal para aplicaciones wearable o de telemedicina donde la calidad de grabación varía. La representación multirresolución, por su parte, ofrece una riqueza de información que puede ser explotada por arquitecturas más profundas o modelos híbridos que combinen CNNs con transformers. En Q2BSTUDIO hemos desarrollado aplicaciones a medida de análisis de señales biomédicas incorporando estas técnicas, y la experiencia nos dice que la elección del espectrograma debe alinearse con el hardware objetivo: un dispositivo embebido con poca memoria probablemente usará PCEN por su eficiencia computacional, mientras que un servidor en la nube puede permitirse el coste adicional de la multirresolución.

Finalmente, cabe destacar que la comunidad científica está explorando variantes como el espectrograma de fase o redes generativas para aumentar datos sintéticos. En este contexto, Q2BSTUDIO ofrece servicios de consultoría en IA para ayudar a empresas a elegir la representación óptima según su dominio específico, ya sea salud, industria o finanzas. La combinación de espectrogramas avanzados con arquitecturas ligeras de CNN representa un paso adelante hacia un diagnóstico cardíaco accesible y automatizado, especialmente en regiones con escasez de especialistas. Con una correcta integración de cloud, ciberseguridad y agentes inteligentes, estas soluciones pueden desplegarse de manera segura y escalable.

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.