En els darrers mesos, els models de llenguatge i visió (Video-LLM) han estat promocionats com a capaços de seguir un personatge al llarg d'un vídeo extens, identificant canvis en la seva vestimenta o accions. No obstant això, un estudi recent revela que aquests sistemes no estan realment 'observant' la persona indicada, sinó que utilitzen dreceres superficials com el gènere per respondre. Aquesta troballa té implicacions profundes per a empreses que depenen de la intel·ligència artificial en tasques de vigilància, atenció al client automatitzada o anàlisi de comportament.
La investigació mostra que quan es canvia el nom del personatge a la pregunta, els models amb prou feines modifiquen les seves respostes (entre un 4% i un 31% de les vegades). Això demostra que no hi ha un veritable seguiment d'identitat. A més, si s'intercanvia el nom per un del mateix gènere, la taxa de canvi és encara menor: els models reaccionen només quan el gènere és diferent. En proves obertes (sense opcions múltiples), la precisió cau dràsticament: els models de codi obert passen d'un 37-38% a un 12-19%, i cap de les 151 respostes va ser completament correcta.
Què significa això per al món empresarial? Imagineu un sistema de videovigilància que ha d'identificar un sospitós concret entre diverses persones, o un assistent virtual que ha de recordar les preferències d'un client específic al llarg d'una interacció llarga. Si el model es basa en pistes gruixudes com el color de la roba o el gènere, cometrà errors costosos. Les empreses que inverteixen en solucions d'IA han de ser conscients d'aquestes limitacions abans de desplegar sistemes crítics.
A Q2BSTUDIO, abordem aquests reptes des d'una perspectiva tècnica i empresarial. No creiem en solucions genèriques d'IA que fallen en contextos reals. Per això desenvolupem aplicacions a mida que integren models de llenguatge i visió amb lògica de negoci específica. Per exemple, combinem la IA amb fluxos de treball personalitzats que verifiquen la identitat dels personatges mitjançant metadades addicionals (com etiquetes temporals o dades de sensors), reduint la dependència de pistes visuals superficials.
El nostre enfocament inclou l'ús de infraestructura cloud a AWS o Azure per escalar el processament de vídeo sense perdre rendiment, i la implementació de capes de ciberseguretat que protegeixen les dades sensibles que aquests sistemes manegen. A més, integrem panells de Business Intelligence amb Power BI perquè els directius puguin auditar el comportament del model i detectar biaixos o errors de seguiment.
Una de les nostres línies més innovadores són els agents d'IA especialitzats. En lloc d'un Video-LLM únic, despleguem múltiples agents que col·laboren: un analitza el moviment, un altre la identitat facial (amb reconeixement biomètric) i un tercer creua la informació amb bases de dades d'usuaris. Aquesta arquitectura modular corregeix els errors dels models monolítics i ofereix un seguiment robust fins i tot en vídeos llargs amb múltiples personatges.
L'estudi també revela que afegir subtítols, utilitzar els fotogrames més informatius o duplicar el nombre d'imatges no millora el seguiment de personatges. Això indica que el coll d'ampolla no és la quantitat de dades visuals, sinó com el model relaciona el vídeo amb la persona nomenada. Per solucionar-ho, a Q2BSTUDIO dissenyem sistemes híbrids que combinen la visió per computador amb lògica simbòlica: per exemple, assignem un identificador únic a cada personatge basat en la seva aparició inicial i el mantenim al llarg de la seqüència mitjançant algorismes d'associació de dades, independentment dels canvis de vestimenta.
La lliçó per a les empreses és clara: no cal confiar cegament en els benchmarks dels Video-LLM. Les puntuacions altes poden ocultar debilitats fonamentals. Per a aplicacions crítiques com la seguretat, l'atenció al client o l'anàlisi de vídeo en retail, cal un enfocament personalitzat que combini IA, cloud, ciberseguretat i BI. A Q2BSTUDIO portem anys desenvolupant programari a mida que supera aquestes limitacions, ajudant els nostres clients a obtenir resultats fiables i accionables.
Si la vostra empresa necessita un sistema de seguiment de persones en vídeo que realment funcioni, us convidem a contactar-nos. Analitzarem el vostre cas, dissenyarem una arquitectura adaptada i la desplegarem al núvol amb total seguretat. No permeteu que un model superficial posi en risc les vostres operacions. La intel·ligència artificial ha de ser tan precisa com el vostre negoci exigeix.




