En l'avanç vertiginós de la intel·ligència artificial, els models multimodals de llenguatge (MLLM) han demostrat una capacitat impressionant per localitzar objectes en imatges, marcar finestres temporals en vídeo o àudio, i fins i tot generar quadres delimitadors amb aparent precisió. No obstant això, un problema persistent en aquestes arquitectures és l'al·lucinació de regions: el model 'inventa' ubicacions que no corresponen amb el contingut real. Fins ara, els mecanismes de confiança basats en probabilitats de tokens resultaven poc fiables, ja que confonien la qualitat de l'ancoratge amb l'ambigüitat de l'entrada. Davant d'això, ha sorgit una proposta nova que prescindeix de l'entrenament addicional i utilitza l'atenció localitzada entre múltiples tokens per mesurar la solidesa d'una predicció. Aquest enfocament, anomenat MTLA (Atenció Localitzada Multi-Token), analitza com els tokens de la predicció atenen a la regió que afirmen descriure, sumant l'atenció dins d'aquesta zona i no sobre tota l'entrada. Els resultats són contundents: millora la detecció d'al·lucinacions entre un 7% i un 38% en múltiples famílies de MLLM i tres modalitats, i en usar-se com a puntuació de confiança per reordenar candidats, eleva el rendiment de detecció d'objectes sense entrenament des d'un 20,4 fins a un 37,0 AP en COCO, acostant-se a detectors supervisats.
Aquesta tècnica té implicacions pràctiques enormes per a empreses que integren intel·ligència artificial en els seus productes, especialment quan es requereix robustesa en aplicacions crítiques. A Q2BSTUDIO desenvolupem ia per a empreses que necessita no només precisió, sinó també transparència en les seves decisions. Per exemple, en implementar un sistema de detecció d'esdeveniments en vídeo per a logística o seguretat, saber quan el model està al·lucinant permet filtrar falsos positius i generar informes fiables. La nostra experiència en aplicacions a mida ens permet adaptar aquestes tècniques d'atenció localitzada a entorns productius, ja sigui al núvol o en dispositius edge.
A més, combinem aquest tipus d'innovacions amb serveis cloud AWS i Azure per escalar solucions d'IA sense comprometre la seguretat. La ciberseguretat és un pilar en els nostres desenvolupaments, especialment quan es manegen dades sensibles com vídeos de vigilància o registres d'àudio. Així mateix, integrem agents IA que, en disposar de mètriques de confiança com MTLA, poden prioritzar les seves accions de forma autònoma. Per a la presa de decisions empresarials, els nostres serveis intel·ligència de negoci amb Power BI visualitzen la fiabilitat de les prediccions, permetent als directius ajustar processos amb dades sòlides. En definitiva, tècniques com l'atenció localitzada multi-token no només representen un avanç acadèmic, sinó una oportunitat real per construir programari a mida més fiable i transparent, on la intel·ligència artificial deixa de ser una caixa negra per convertir-se en un aliat estratègic.

.jpg)



