Robant la mida de pegat: atac adversarial a models VLM

Descobreix com els atacants poden robar la mida de pegat de models VLM i manipular-los. Aprèn sobre aquesta vulnerabilitat i com protegir els teus models.

jueves, 2 de julio de 2026 • 3 min de lectura • Equip Q2BSTUDIO

Atac de canal lateral per robar configuració de VLMs

En els darrers anys, l'adopció de models de llenguatge i visió (VLM) en entorns empresarials s'ha disparat. Aquests sistemes, capaços d'interpretar imatges i generar text, s'integren en aplicacions a mida que van des d'assistents virtuals fins a eines d'anàlisi documental. Tanmateix, investigacions recents han destapat una nova classe de vulnerabilitat que ataca directament la configuració interna d'aquests models: el robatori de la mida de pegat i els paràmetres de preprocessament visual mitjançant atacs de canal lateral.

Aquest tipus d'atac, de naturalesa black-box (sense accés intern al model), explota una propietat fonamental dels Vision Transformers (ViT): la divisió de la imatge en pegats. En alimentar el model amb una graella sintètica, l'agressor pot detectar caigudes periòdiques en la precisió quan la mida de cel·la de la graella coincideix exactament amb la mida de pegat ocult. És aleshores quan els límits entre cel·les s'esborren durant la tokenització, generant un patró mesurable. A partir d'aquí, variant l'emplenament (padding) i realitzant proves de consistència, és possible determinar si el preprocessament utilitza resolució dinàmica o fixa, i fins i tot recuperar la resolució de redimensionament objectiu.

Aquest vector d'atac té implicacions profundes per a la ciberseguretat empresarial. Si un adversari aconsegueix extreure la configuració exacta del tokenitzador visual d'un model propietari (com els desplegats a GPT, Claude o variants obertes de Qwen-VL), pot construir atacs de transferència altament efectius, adaptant exemples adversarials al preprocessament específic del model víctima. En un context on cada cop més companyies externalitzen serveis cloud AWS i Azure per allotjar els seus models d'intel·ligència artificial, el risc de filtratge de paràmetres interns esdevé crític.

Per a les organitzacions que desenvolupen IA per a empreses, protegir aquests detalls d'implementació és tan rellevant com blindar les dades d'entrenament. Una configuració de pegat filtrada permet manipular el comportament del model amb alta precisió, generant des de distorsions visuals imperceptibles fins a canvis complets en la sortida del sistema. Això afecta directament els serveis de ciberseguretat que han de garantir la integritat dels models desplegats en producció.

Més enllà de l'atac en si, aquesta troballa subratlla la necessitat de redissenyar la forma en què es protegeixen les arquitectures d'aprenentatge automàtic. Les tècniques tradicionals d'ofuscació (com ocultar pesos o usar APIs intermèdies) són insuficients quan existeix un canal lateral basat en la resposta del model. La solució passa per incorporar principis de seguretat des del disseny, incloent l'aleatorització de mides de pegat, l'aplicació de soroll controlat en la tokenització, i la monitorització de patrons de consulta anòmals que puguin estar explorant aquestes propietats.

A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que la intel·ligència artificial s'ha d'implementar amb una visió holística de la seguretat. Els nostres equips integren anàlisi de vulnerabilitats en cada fase del cicle de vida del programari a mida, des de la definició de requisits fins al desplegament en serveis cloud AWS i Azure. També apliquem serveis d'intel·ligència de negoci i Power BI per detectar patrons d'ús inusuals en models desplegats, complementant amb agents IA que automatitzen la resposta davant amenaces.

La investigació sobre el robatori de mida de pegat ens recorda que la transparència dels models moderns té un preu: cada resposta revela informació sobre la seva arquitectura. Per a les empreses que aposten per aplicacions a mida basades en visió per computador, entendre i mitigar aquests canals laterals es converteix en un requisit no funcional indispensable. No es tracta només de protegir el model, sinó de salvaguardar l'avantatge competitiu que representa una implementació segura d'intel·ligència artificial.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.