En los últimos meses, los modelos de lenguaje y visión (Video-LLM) han sido promocionados como capaces de seguir a un personaje a lo largo de un vídeo extenso, identificando cambios en su vestimenta o acciones. Sin embargo, un estudio reciente revela que estos sistemas no están realmente 'observando' a la persona indicada, sino que utilizan atajos superficiales como el género para responder. Este hallazgo tiene implicaciones profundas para empresas que dependen de la inteligencia artificial en tareas de vigilancia, atención al cliente automatizada o análisis de comportamiento.
La investigación muestra que cuando se cambia el nombre del personaje en la pregunta, los modelos apenas modifican sus respuestas (entre un 4% y un 31% de las veces). Esto demuestra que no hay un verdadero seguimiento de identidad. Además, si se intercambia el nombre por uno del mismo género, la tasa de cambio es aún menor: los modelos reaccionan solo cuando el género es diferente. En pruebas abiertas (sin opciones múltiples), la precisión cae drásticamente: los modelos de código abierto pasan de un 37-38% a un 12-19%, y ninguna de las 151 respuestas fue completamente correcta.
¿Qué significa esto para el mundo empresarial? Imagínese un sistema de videovigilancia que debe identificar a un sospechoso concreto entre varias personas, o un asistente virtual que debe recordar las preferencias de un cliente específico a lo largo de una interacción larga. Si el modelo se basa en pistas gruesas como el color de la ropa o el género, cometerá errores costosos. Las empresas que invierten en soluciones de IA deben ser conscientes de estas limitaciones antes de desplegar sistemas críticos.
En Q2BSTUDIO, abordamos estos desafíos desde una perspectiva técnica y empresarial. No creemos en soluciones genéricas de IA que fallan en contextos reales. Por eso desarrollamos aplicaciones a medida que integran modelos de lenguaje y visión con lógica de negocio específica. Por ejemplo, combinamos la IA con flujos de trabajo personalizados que verifican la identidad de los personajes mediante metadatos adicionales (como etiquetas temporales o datos de sensores), reduciendo la dependencia de pistas visuales superficiales.
Nuestro enfoque incluye el uso de infraestructura cloud en AWS o Azure para escalar el procesamiento de vídeo sin perder rendimiento, y la implementación de capas de ciberseguridad que protegen los datos sensibles que estos sistemas manejan. Además, integramos paneles de Business Intelligence con Power BI para que los directivos puedan auditar el comportamiento del modelo y detectar sesgos o fallos de seguimiento.
Una de nuestras líneas más innovadoras son los agentes de IA especializados. En lugar de un Video-LLM único, desplegamos múltiples agentes que colaboran: uno analiza el movimiento, otro la identidad facial (con reconocimiento biométrico) y un tercero cruza la información con bases de datos de usuarios. Esta arquitectura modular corrige los errores de los modelos monolíticos y ofrece un seguimiento robusto incluso en vídeos largos con múltiples personajes.
El estudio también revela que añadir subtítulos, usar los fotogramas más informativos o duplicar el número de imágenes no mejora el seguimiento de personajes. Esto indica que el cuello de botella no es la cantidad de datos visuales, sino cómo el modelo relaciona el vídeo con la persona nombrada. Para solucionarlo, en Q2BSTUDIO diseñamos sistemas híbridos que combinan la visión por computador con lógica simbólica: por ejemplo, asignamos un identificador único a cada personaje basado en su aparición inicial y lo mantenemos a lo largo de la secuencia mediante algoritmos de asociación de datos, independientemente de cambios de vestimenta.
La lección para las empresas es clara: no hay que confiar ciegamente en los benchmarks de los Video-LLM. Las puntuaciones altas pueden ocultar debilidades fundamentales. Para aplicaciones críticas como la seguridad, la atención al cliente o el análisis de vídeo en retail, es necesario un enfoque personalizado que combine IA, cloud, ciberseguridad y BI. En Q2BSTUDIO llevamos años desarrollando software a medida que supera estas limitaciones, ayudando a nuestros clientes a obtener resultados fiables y accionables.
Si su empresa necesita un sistema de seguimiento de personas en vídeo que realmente funcione, le invitamos a contactarnos. Analizaremos su caso, diseñaremos una arquitectura adaptada y la desplegaremos en la nube con total seguridad. No permita que un modelo superficial ponga en riesgo sus operaciones. La inteligencia artificial debe ser tan precisa como su negocio lo exige.





