Els models de llenguatge i visió (VLMs) han demostrat capacitats impressionants en tasques com descripció d'imatges, resposta a preguntes visuals i raonament multimodal. No obstant això, una fallada recurrent i desconcertant és el seu pobre rendiment en tasques de comptatge bàsic: preguntar quants objectes hi ha en una imatge sovint porta a respostes incorrectes, fins i tot en situacions simples. Investigacions recents revelen que el problema no resideix en una falta de coneixement intern del model, sinó en una desconnexió entre el que el model sap internament i el que és capaç de verbalitzar. Aquesta troballa obre noves vies per entendre i corregir aquests errors, i té implicacions profundes per al desenvolupament d'aplicacions d'intel·ligència artificial més fiables.
L' estudi de referència analitza quatre models VLM enfront de cinc conjunts de dades de comptatge. Mitjançant l'entrenament de sondes lineals i no lineals sobre les activacions internes dels models, els investigadors van descobrir que sondes no lineals poden detectar quan el model va cometre un error de comptatge. És a dir, el model codifica internament el nombre correcte d' objectes, però aquest coneixement no es tradueix correctament en la resposta final. Aquest fenomen és similar a quan un estudiant sap la resposta però s'equivoca en expressar-la. L'anàlisi SVCCA (Singular Vector Canonical Correlation Analysis) mostra que les sondes entrenades amb valors veritables i les entrenades amb les sortides del model ocupen un subespai d'activacions parcialment compartit, però les direccions de lectura estan desalineades. Això suggereix que les representacions internes del comptatge correcte existeixen, però no s' alineen amb les representacions que el model utilitza per generar el text de sortida.
La confirmació definitiva arriba mitjançant intervencions de steering causal: en reforçar les direccions de les sondes que identifiquen el comptatge correcte, el rendiment del model millora significativament. Això demostra que el coneixement intern és accessible i modificable. A partir d'aquesta troballa, els autors proposen un mètode d'autocorrecció guiat per detector: el model genera una resposta, una sonda interna prediu si aquesta resposta serà incorrecta, i només en aquest cas es torna a preguntar al model de manera diferent. Aquesta intervenció en temps d' inferència, sense necessitat d' actualitzar paràmetres, millora la precisió de comptatge fins a 15,6 punts percentuals absoluts.
Per a les empreses que integren intel·ligència artificial en els seus processos, aquestes conclusions són crucials. Un model que sap comptar però no ho diu bé pot generar errors costosos en aplicacions com inventari automatitzat, control de qualitat visual, anàlisi d'imatges mèdiques o comptatge de persones en entorns de seguretat. Entendre que la falla està en la verbalització i no en la cognició permet dissenyar estratègies de mitigació més efectives que simplement entrenar amb més dades. Per exemple, es pot implementar un sistema de doble verificació: el model genera una resposta, després un detector intern avalua la confiança en aquesta resposta i, si és baixa, es recorre a un procés de raonament alternatiu o es consulta a un humà.
En Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, apliquem aquests principis en les nostres solucions d'intel·ligència artificial per a empreses. El nostre equip dissenya sistemes que no només utilitzen models preentrenats, sinó que incorporen capes de verificació i correcció interna per millorar la fiabilitat. Treballem en el desenvolupament d' aplicacions a mesura que integren agents IA capaços d' autoavaluar-se i corregir-se, la qual cosa resulta especialment útil en entorns on l' error té un alt cost.
A més, perquè aquests sistemes funcionin de manera robusta en producció, cal comptar amb una infraestructura sòlida. Per això oferim serveis cloud aws i azure que permeten desplegar models de visió i llenguatge amb baixa latència i alta disponibilitat. La gestió de les dades i la seguretat també són crítiques; les nostres solucions de ciberseguretat garanteixen que les dades sensibles utilitzades en aquests models estiguin protegides. I perquè les empreses puguin prendre decisions basades en aquests resultats, integrem serveis intel·ligència de negoci com power bi que visualitzen les mètriques de rendiment dels models i els errors detectats, facilitant la millora contínua.
En definitiva, la investigació sobre la bretxa entre el coneixement intern i la verbalització en VLMs no només és rellevant per a l'acadèmia, sinó que té aplicacions pràctiques immediates. Ens permet construir sistemes d'IA més transparents, controlables i precisos. La pròxima vegada que un VLM falli en comptar, recordi que probablement sí que sap la resposta; només necessita que l'ajudem a expressar-la. I en Q2BSTUDIO estem preparats per dissenyar aquestes ajudes, ja sigui mitjançant programari a mida o integrant tècniques d'automatització de processos amb agents intel·ligents.





