Equipo HSEmotion en ABAW 11: Reconocimiento Multitarea y Ambivalencia

Conoce cómo el equipo HSEmotion utiliza fusión multimodal ligera para destacar en el desafío ABAW 11, logrando altos puntajes F1 en reconocimiento de video.

lunes, 27 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Modelos ligeros alcanzan alto rendimiento en ABAW 11

El análisis del comportamiento afectivo en entornos no controlados ha alcanzado un nuevo hito con la undécima edición del concurso Affective Behavior Analysis in-the-Wild (ABAW 11). Este evento, que impulsa la investigación en reconocimiento de emociones, expresión facial y unidades de acción, ha visto cómo equipos como HSEmotion presentan soluciones que combinan eficiencia computacional y precisión. En este artículo exploramos las claves técnicas de su propuesta, centrada en el aprendizaje multitarea y la detección de ambivalencia, y las conectamos con el desarrollo de aplicaciones empresariales avanzadas. Desde la perspectiva de Q2BSTUDIO, empresa especializada en aplicaciones a medida, estas innovaciones abren la puerta a sistemas de IA más ligeros, seguros y adaptables al mundo real.

La competición ABAW 11 se estructura en dos grandes tareas. La primera es el aprendizaje multitarea sobre el conjunto de datos s-Aff-Wild2, donde se deben predecir simultáneamente valencia, arousal, expresiones faciales y unidades de acción. La segunda tarea se centra en el reconocimiento de videos de ambivalencia o hesitación sobre el conjunto de datos BAH ampliado. En ambos casos, el equipo HSEmotion ha demostrado que es posible lograr un rendimiento competitivo sin recurrir a modelos pesados ni a un ajuste fino de backbones completos. Su estrategia se basa en extractores faciales ligeros congelados (MT-EmotiDDAMFN y MT-EmotiEffNet-B0), cabezales separados por tarea y un post-procesado sistemático que incluye suavizado gaussiano temporal, ajuste de sesgo por expresión, mezcla con AffectNet, optimización de umbrales por unidad de acción y fusión ponderada de backbones. Este enfoque, según los resultados oficiales, supera significativamente la línea base de ConvNeXt en el conjunto de validación.

Para la detección de ambivalencia, el pipeline audiovisual se extiende a nivel de video mediante fusión tardía de clasificadores de rostro, audio (HuBERT) y texto (RoBERTa), agregación temporal y una puerta de texto global. El resultado es un aumento del Weighted F1 a nivel de fotograma de 0.74 a 0.79 respecto a la edición anterior (ABAW-8), y un Macro F1 a nivel de video de 0.73 en la prueba pública. Estos datos confirman que la calibración sistemática de predicciones y la fusión multimodal ligera pueden rivalizar con enfoques pesados de extremo a extremo, ofreciendo además una mayor eficiencia y flexibilidad de despliegue.

Desde una óptica empresarial, estas técnicas tienen un impacto directo en el desarrollo de soluciones de IA para sectores como la salud mental, la educación o la atención al cliente. La posibilidad de ejecutar modelos ligeros en dispositivos periféricos (edge computing) o en la nube sin consumir recursos excesivos es clave para aplicaciones en tiempo real. En Q2BSTUDIO integramos estos principios en nuestros proyectos de aplicaciones a medida, combinando inteligencia artificial con servicios cloud como AWS o Azure para escalar soluciones de forma segura. La ciberseguridad también juega un papel fundamental: al procesar datos biométricos faciales, es vital proteger la información mediante cifrado y buenas prácticas de pentesting, algo que ofrecemos desde nuestra área de ciberseguridad.

El uso de modelos congelados y cabezales ligeros, tal como lo hace HSEmotion, es una tendencia que se alinea con la necesidad empresarial de reducir costes computacionales sin sacrificar precisión. En lugar de entrenar redes masivas desde cero, se pueden reutilizar extractores preentrenados y afinar únicamente las capas específicas. Esto acelera el tiempo de desarrollo y permite iterar rápidamente sobre nuevas tareas. Por ejemplo, en un sistema de análisis de sentimientos en videoconferencias, podríamos emplear un extractor facial ligero y añadir cabezales para detectar emociones, mirar o gestos, todo con un post-procesado similar al descrito. La combinación con Business Intelligence (Power BI) permite visualizar en tiempo real la evolución del estado anímico de los participantes, integrando datos de audio y texto para enriquecer el análisis.

Otro aspecto relevante es la fusión multimodal. En el mundo empresarial, rara vez se dispone de un único flujo de datos. Las soluciones efectivas deben combinar imágenes, sonido y texto para obtener una visión completa. El pipeline de HSEmotion para ambivalencia es un ejemplo perfecto: fusión tardía de tres modalidades con agregación temporal. En Q2BSTUDIO aplicamos principios similares en proyectos de automatización de procesos y agentes IA, donde un asistente virtual puede entender no solo lo que dice el usuario, sino también cómo lo dice (tono de voz) y su expresión facial. Esto mejora la experiencia de cliente y permite detectar estados de confusión o insatisfacción antes de que se conviertan en problemas mayores.

La calibración de predicciones es otro punto diferencial. Muchos modelos producen salidas poco calibradas, lo que lleva a falsos positivos o negativos. El equipo HSEmotion aplica un post-procesado cuidadoso: suavizado gaussiano para evitar cambios bruscos, ajuste de sesgo para equilibrar clases desbalanceadas, y optimización de umbrales por unidad de acción. Estas técnicas son directamente transferibles a sistemas de clasificación empresarial, como la moderación de contenido o la detección de fraude. En Q2BSTUDIO ayudamos a nuestros clientes a implementar tales estrategias dentro de sus plataformas, asegurando que los modelos no solo sean precisos, sino también robustos y explicables.

La eficiencia computacional también es crítica para el despliegue en la nube. Utilizar extractores congelados y ensamblajes ligeros reduce el consumo de instancias de AWS o Azure, disminuyendo los costes operativos. Además, la arquitectura modular facilita la actualización de componentes sin tener que reentrenar todo el sistema. En nuestro departamento de cloud AWS/Azure, diseñamos pipelines que aprovechan estas ventajas, ofreciendo elasticidad y alta disponibilidad para aplicaciones de procesamiento afectivo a gran escala.

Por último, la orientación a resultados de la competición ABAW 11 refleja una filosofía que compartimos en Q2BSTUDIO: la innovación técnica debe traducirse en valor tangible para el negocio. Ya sea mejorando la satisfacción del cliente, automatizando la detección de emociones en entornos educativos o analizando entrevistas de trabajo para identificar señales de ambivalencia, las técnicas presentadas por HSEmotion demuestran que es posible lograr alta precisión sin necesidad de inversiones desmesuradas en hardware o tiempo de entrenamiento. En un mercado donde la velocidad y la adaptabilidad son esenciales, este enfoque ligero y calibrado se convierte en una ventaja competitiva.

En conclusión, el trabajo del equipo HSEmotion en ABAW 11 ofrece lecciones valiosas para cualquier organización que busque integrar reconocimiento de emociones y análisis multimodal en sus aplicaciones. La combinación de extractores ligeros, fusión de modalidades, post-procesado sistemático y evaluación rigurosa forma una receta que puede replicarse en proyectos de software a medida, inteligencia artificial, ciberseguridad y cloud computing. En Q2BSTUDIO estamos preparados para ayudar a las empresas a adoptar estas tecnologías, adaptándolas a sus necesidades específicas y garantizando un despliegue eficiente y seguro. El futuro del análisis afectivo en la empresa no está en modelos colosales, sino en soluciones inteligentes, ligeras y bien calibradas.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.