Omnilingual ASR-LLM System for the 2nd MLC-SLM Challenge

Our cascaded diarization-then-recognition system using an omniASR LLM achieves 50.23% tcpMER on the evaluation set.

lunes, 27 de julio de 2026 • 4 min read • Q2BSTUDIO Team

Reconocimiento de voz multilingüe con diarización

En el panorama actual de la inteligencia artificial, los sistemas de reconocimiento automático del habla (ASR) han evolucionado hacia arquitecturas capaces de procesar múltiples idiomas y acentos con una precisión nunca vista. Un ejemplo destacado es la participación en el 2nd MLCSLM Challenge, donde se presentó un sistema en cascada que combina segmentación con DiariZen-Large-s80, extracción de embeddings con CAM++ y un modelo de lenguaje grande (LLM) adaptado mediante LoRA para el reconocimiento omnilingüe. Este enfoque no solo logra superar las líneas base oficiales en métricas como tcpMER, sino que también revela lecciones importantes sobre el diseño de sistemas robustos para entornos con múltiples hablantes y solapamiento de voz. En este artículo analizamos la arquitectura desde una perspectiva técnica y empresarial, explorando cómo las empresas pueden adoptar estas tecnologías para mejorar sus productos y servicios.

El sistema propuesto opera en dos etapas principales: primero, la segmentación y diarización de hablantes, y segundo, el reconocimiento de la transcripción. La diarización se basa en un modelo WavLM-Large preentrenado (DiariZen-Large-s80) que detecta cuándo comienza y termina cada intervención, seguido de un clustering con embeddings CAM++ para asignar cada segmento a uno de los dos hablantes presentes en las conversaciones del desafío. Esta separación es crucial, ya que errores en la asignación de hablantes pueden propagarse al reconocimiento. Los resultados mostraron que el clustering basado en embeddings supera claramente a las alternativas que solo usan marcas de turno del ASR, lo que subraya la importancia de una representación rica de la voz.

El reconocimiento, por su parte, utiliza un LLM de 7 mil millones de parámetros (omniASR LLM 7B v2) adaptado con LoRA para optimizar la transcripción en 21 categorías de idiomas y acentos. La incorporación de modelos de lenguaje grandes permite manejar contextos amplios y corregir ambigüedades fonéticas, pero también introduce desafíos de latencia y costo computacional. Las pruebas sobre el conjunto de desarrollo oficial (150 conversaciones) arrojaron un tcpMER macro del 29.27%, frente al 79.15% de la línea base, mientras que en el conjunto de evaluación se obtuvo un 50.23%. Estas cifras demuestran una mejora significativa, aunque también indican la dificultad de generalizar a datos no vistos.

Un hallazgo relevante del estudio es que el uso de segmentación consciente de solapamiento (overlap-aware segmentation) puede incrementar el tcpMER. Esto ocurre porque cuando dos hablantes hablan al mismo tiempo, el sistema tiende a transcribir la misma porción de audio dos veces, generando duplicaciones que penalizan la métrica. Esta observación es clave para el diseño de sistemas comerciales: en aplicaciones de reuniones o llamadas, donde el solapamiento es frecuente, es mejor priorizar la precisión de la transcripción única sobre la recuperación de todos los solapamientos. Las empresas que desarrollan soluciones de transcripción automática deben equilibrar la cobertura y la exactitud, y aquí es donde la personalización juega un rol fundamental.

Desde la perspectiva de negocio, implementar un sistema ASR omnilingüe con LLM no es trivial. Requiere experiencia en inteligencia artificial, integración de modelos preentrenados y optimización para entornos de producción. Q2BSTUDIO, como empresa de desarrollo de software y tecnología, ofrece servicios que abarcan desde la creación de aplicaciones a medida hasta el despliegue en infraestructuras cloud como AWS o Azure. La capacidad de adaptar modelos LLM mediante técnicas como LoRA, o de construir pipelines de diarización robustos, se alinea con las competencias de un equipo experto en IA y automatización. Además, la gestión de datos de audio multilingües exige un enfoque cuidadoso en ciberseguridad para proteger la privacidad de las conversaciones, un servicio que Q2BSTUDIO también ofrece a través de pentesting y consultoría de seguridad.

Otro aspecto relevante es la integración de estos sistemas con plataformas de Business Intelligence (BI). Una vez que las transcripciones se generan, se pueden analizar con herramientas como Power BI para extraer patrones de conversación, tendencias de sentimiento o frecuencia de términos clave. Esto convierte al ASR en un habilitador de inteligencia de negocio, permitiendo a las organizaciones tomar decisiones basadas en datos extraídos directamente de interacciones de voz. Q2BSTUDIO, con su experiencia en BI / Power BI, ayuda a diseñar dashboards que visualicen estos indicadores de forma clara y accionable.

Por último, la tendencia hacia agentes de IA autónomos que interactúan con usuarios mediante voz abre nuevas oportunidades. Los sistemas ASR omnilingües son el componente auditivo de estos agentes, permitiendo que asistentes virtuales, chatbots o robots de atención al cliente comprendan y respondan en múltiples lenguas. Q2BSTUDIO está a la vanguardia en el desarrollo de agentes IA personalizados, combinando reconocimiento de voz, procesamiento de lenguaje natural y lógica de negocio para crear soluciones que mejoren la experiencia del usuario y automaticen procesos. En un mundo cada vez más globalizado, contar con tecnología que entienda diferentes acentos y dialectos no es solo una ventaja competitiva, sino una necesidad.

En conclusión, el sistema presentado en el MLCSLM Challenge ejemplifica el potencial de combinar diarización de última generación con LLMs adaptados. Sin embargo, su implementación real requiere un enfoque integral que considere la escalabilidad, la precisión y la seguridad. Empresas como Q2BSTUDIO están preparadas para guiar a las organizaciones en este camino, ofreciendo servicios de software a medida, cloud, ciberseguridad, BI e IA. La evolución del ASR omnilingüe no se detiene, y quienes inviertan hoy en estas tecnologías estarán mejor posicionados para liderar el mañana.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.