ST-Veto: Veto de Tokens Espai-Temporals per a dMLLMs

ST-Veto millora fins a un 9% la precisió de models multimodals difusos sense cost addicional, usant veto de tokens i ancoratge visual. Descobreix-ho.

sábado, 25 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Cómo ST-Veto mejora el razonamiento multimodal sin entrenamiento

Els models de llenguatge i visió (VLMs) han demostrat una capacitat de raonament notable quan es combinen amb tècniques de Chain-of-Thought (CoT). No obstant això, aquesta aproximació pateix un alt cost computacional seqüencial, acumulació d'errors i una capacitat d'autocorrecció molt limitada. Enfront d'això, els models de llenguatge multimodal difusius (dMLLMs) ofereixen una alternativa prometedora: en lloc de generar tokens un darrere l'altre, els descobreixen en un procés independent de l'ordre, cosa que permet una eficiència superior i un refinament iteratiu. Tot i això, el raonament i la manera de millorar-lo amb prou feines s'han explorat en aquest nou paradigma.

Ara sorgeix una solució innovadora i completament lliure d'entrenament: ST-Veto (Veto de Tokens Espai-Temporals). Aquest mètode aprofita la capacitat única dels dMLLMs d'observar totes les posicions de tokens en cada pas de difusió. En lloc de basar-se únicament en la confiança del pas actual, ST-Veto avalua l'estabilitat temporal de cada token mitjançant una predicció de segon ordre de la dinàmica de confiança, i filtra aquells tokens amb un ancoratge visual feble usant la massa d'atenció de la imatge. Els tokens inestables o poc fonamentats són vetats i substituïts per candidats més segurs, guiant la generació cap a trajectòries de major confiança i millor fonamentació.

En les proves realitzades sobre múltiples dMLLMs i benchmarks de raonament multimodal, ST-Veto va superar de forma consistent les polítiques de decodificació estàndard i mètodes previs de raonament per a VLMs, aconseguint millores de precisió de fins a un 9% sense cap cost addicional d'entrenament o generació. Aquest avenç no només demostra que és possible millorar el raonament en models difusius sense necessitat de dades extra, sinó que obre la porta a aplicacions pràctiques on la fiabilitat i l'eficiència són crítiques.

Des d'una perspectiva empresarial, la capacitat de millorar el raonament dels models d'IA sense augmentar el cost computacional és un factor diferencial clau. A Q2BSTUDIO, entenem que la intel·ligència artificial s'ha d'integrar de forma natural en els processos de negoci, i per a això no n'hi ha prou amb models potents: es necessita un disseny acurat de l'arquitectura de raonament. El nostre equip ha treballat en múltiples projectes on apliquem tècniques d'IA avançades, des de sistemes de diàleg fins a anàlisi predictiva, sempre buscant la màxima eficiència i precisió.

La naturalesa lliure d'entrenament de ST-Veto el converteix en especialment atractiu per a entorns on els recursos de computació són limitats o on es requereix una ràpida implementació. Per exemple, en el desenvolupament d'agents IA que han de prendre decisions en temps real, la capacitat de refinar iterativament les prediccions sense necessitat de reentrenar el model suposa un avantatge competitiu considerable. A les nostres solucions d'aplicacions a mida, hem incorporat mecanismes de raonament similars per millorar la robustesa d'assistents virtuals i motors de recomanació, sempre adaptant-nos a les necessitats específiques del client.

A més, la fonamentació visual que aporta ST-Veto —gràcies a l'anàlisi de la massa d'atenció sobre la imatge— és especialment rellevant en aplicacions de ciberseguretat, on la validació de la informació visual pot prevenir atacs adversarials o deteccions falses. A Q2BSTUDIO oferim serveis de ciberseguretat que integren tècniques d'IA per monitoritzar amenaces en temps real, i la capacitat de vetar tokens basats en el seu ancoratge visual podria reforçar la fiabilitat d'aquests sistemes.

Un altre àmbit on el veto espai-temporal pot marcar la diferència és en l'analítica de negoci. Les plataformes de BI/Power BI es beneficien de models que entenen tant dades numèriques com gràfics i imatges. En aplicar una estratègia de raonament més robusta, es redueixen els errors d'interpretació i s'augmenta la confiança en els informes generats automàticament. A Q2BSTUDIO hem desenvolupat solucions de Business Intelligence amb Power BI que integren models de llenguatge per generar narratives explicatives de les dades, i tècniques com ST-Veto podrien millorar la precisió d'aquestes narratives.

La infraestructura també juga un paper crucial. Per executar models difusius amb alta eficiència, cal comptar amb una arquitectura cloud escalable. Els nostres serveis cloud a AWS i Azure estan dissenyats per albergar càrregues de treball d'IA intensives, oferint elasticitat i reducció de costos. La combinació d'un mètode de decodificació eficient com ST-Veto amb una infraestructura optimitzada permet a les empreses desplegar solucions de raonament multimodal a gran escala sense incórrer en despeses prohibitives.

Mirant cap al futur, la línia de recerca oberta per ST-Veto suggereix que els dMLLMs encara tenen un gran potencial per explotar. La capacitat d'observar totes les posicions de tokens simultàniament permet estratègies de veto molt més sofisticades que les basades únicament en la confiança local. Per exemple, es podrien incorporar mecanismes d'atenció creuada entre tokens i regions de la imatge per refinar encara més la fonamentació. A Q2BSTUDIO seguim de prop aquests avenços per traslladar-los als nostres clients en forma de productes innovadors.

En resum, ST-Veto representa un pas endavant significatiu en el raonament de models multimodals, demostrant que és possible millorar la precisió i la robustesa sense necessitat d'entrenament addicional. Des de la perspectiva d'una empresa de desenvolupament de programari com Q2BSTUDIO, aquest tipus d'innovacions ens permet oferir solucions d'IA més fiables, eficients i adaptades a les necessitats reals del mercat, ja sigui en aplicacions a mida, cloud, ciberseguretat o intel·ligència de negoci. La clau és entendre que el veritable valor de la IA no rau només en els models, sinó en com els integrem en processos que generin impacte tangible.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.