Els models de llenguatge i visió (VLM) han demostrat una capacitat impressionant per interpretar imatges i respondre preguntes complexes. Tanmateix, quan s'enfronten a entrades visualment ambigües —com una foto borrosa, un objecte parcialment ocultat o una escena amb múltiples interpretacions— solen generar respostes amb una confiança desproporcionada, cosa que pot derivar en prediccions esbiaixades i poc fiables. Aquest fenomen planteja un repte crític per a aplicacions reals on la incertesa ha de ser gestionada, com en sistemes de diagnòstic mèdic assistit per intel·ligència artificial o vehicles autònoms.
Les tècniques tradicionals per mesurar la incertesa, com l'Entropia Semàntica (SE), es basen en la diversitat de les respostes generades mitjançant decodificació estocàstica. Quan el model produeix frases molt similars, l'entropia és baixa, cosa que indicaria alta confiança. No obstant això, investigacions recents revelen que, en presència d'ambigüitat visual, els embeddings visuals tendeixen a ser massa segurs, suprimint la variabilitat en les sortides. Com a resultat, la SE subestima sistemàticament la incertesa real, enganyant a qui confia en aquestes mètriques.
Per superar aquesta limitació, diversos enfocaments han proposat introduir pertorbacions en les entrades, per exemple reescrivint la pregunta textual o modificant lleugerament la imatge i el text de manera conjunta. Encara que aquestes tècniques milloren la detecció d'incertesa, una anàlisi més profunda mostra que la variabilitat observada sol estar dominada per canvis en el llenguatge més que per l'evidència visual. És a dir, el model sembla insegur perquè la pregunta canvia, no perquè la imatge sigui ambigua. Això resulta contraproduent: es confon la sensibilitat al prompt amb la veritable ambigüitat visual.
Davant aquesta problemàtica, sorgeix l'Entropia Semàntica Visual (VSE), un mètode que pertorba exclusivament la imatge mentre manté fixa la consulta de text. En generar variacions properes de la mateixa escena —per exemple, mitjançant transformacions geomètriques, canvis subtils d'il·luminació o soroll controlat— el model produeix un conjunt de respostes la dispersió semàntica de les quals reflecteix únicament l'ambigüitat visual. Aquestes respostes s'agrupen en prototips semàntics i es calcula una dispersió ponderada per massa, oferint una estimació d'incertesa molt més fidel a la realitat.
La VSE ha estat avaluada en cinc models moderns de llenguatge i visió, així com en cinc conjunts de dades diversos de pregunta-resposta visual (VQA), establint un nou estat de l'art en l'estimació d'incertesa per a VLMs. Aquest avanç és especialment rellevant per a empreses que integren intel·ligència artificial per a empreses en els seus processos, on la fiabilitat de les prediccions impacta directament en la presa de decisions.
Des d'una perspectiva pràctica, implementar sistemes que gestionin correctament l'ambigüitat visual requereix no només models avançats, sinó també una infraestructura robusta. A Q2BSTUDIO, desenvolupem programari a mida capaç d'integrar aquests algoritmes d'incertesa en fluxos de treball reals, ja sigui per a anàlisi d'imatges mèdiques, control de qualitat industrial o assistents virtuals que entenen el context visual amb precisió. A més, oferim serveis cloud AWS i Azure per escalar el processament d'imatges i la inferència de models de manera eficient, així com serveis d'intel·ligència de negoci amb Power BI per visualitzar les mètriques de confiança i alertar sobre prediccions dubtoses.
La ciberseguretat també juga un paper important: quan un model d'IA expressa baixa incertesa davant una imatge ambigua, podria estar sent enganyat per un atac adversarial. Per això, des de Q2BSTUDIO integrem ciberseguretat i proves de penetració en els sistemes que despleguen aquests models. Així mateix, l'ús d'agents IA que interactuen amb entorns visuals —com robots de magatzem o drons d'inspecció— es beneficia directament de tècniques com la VSE per evitar decisions catastròfiques basades en falses certeses.
En definitiva, l'Entropia Semàntica Visual representa un pas ferm cap a models de visió i llenguatge més transparents i responsables. Combinada amb aplicacions a mida i una estratègia d'integració tecnològica sòlida, permet a les organitzacions aprofitar tot el potencial de la intel·ligència artificial sense caure en les trampes de la sobreconfiança. A Q2BSTUDIO estem preparats per ajudar a dissenyar i implementar aquestes solucions, connectant la recerca més puntera amb les necessitats reals del mercat.

.jpg)



