La verificació d'identitat mitjançant empremtes digitals és una de les tecnologies biomètriques més esteses, però els sistemes tradicionals sovint s'enfronten a limitacions de precisió, escalabilitat i adaptabilitat a contextos no controlats. Amb l'auge dels models multimodals de llenguatge gran (MLLMs), sorgeix una nova perspectiva: interpretar imatges completes d'empremtes SLAP (quatre dits d'una mà en una sola captura plana) sense necessitat d'entrenament específic. No obstant això, fins ara no existia un marc d'avaluació estandarditzat per mesurar el rendiment d'aquests models en aquesta tasca. SLAPBench arriba per omplir aquest buit.
SLAPBench és el primer benchmark dissenyat específicament per avaluar la capacitat dels MLLMs en la verificació d'identitat a partir d'imatges SLAP. Construït sobre el conjunt de dades NIST SD302b, inclou 7.832 parells d'imatges (176 aparellades i 7.656 no aparellades), cosa que permet proves exhaustives tant de falsa acceptació com de falsa negació. L'estudi original va avaluar quatre models de codi obert (InternVL3-8B, Qwen2.5-VL-7B, Qwen3-VL-8B i Gemma-3-12B) juntament amb el propietari Claude Opus 4.8, utilitzant diferents estratègies de prompting: zero-shot, descripció de tasca i puntuació de similitud.
Els resultats revelen que el prompting governa el comportament del model en termes de col·lapse (taxa de falsa acceptació propera al 100%), mentre que la capacitat del model determina la discriminació real. Sota prompting de descripció de tasca, tots els models de codi obert van col·lapsar; Gemma-3-12B també va col·lapsar en zero-shot. Només Claude Opus 4.8 va resistir el col·lapse en ambdós prompts binaris, aconseguint una FAR del 20,2%. En canvi, en utilitzar puntuació de similitud, els models de codi obert van deixar de col·lapsar i es van exposar diferències profundes: Claude va assolir un AUC de 0,953, Gemma-3-12B 0,837, InternVL3-8B va obtenir un resultat invertit (0,590) i Qwen2.5-VL-7B va ser gairebé aleatori (0,567). Sorprenentment, Qwen3-VL-8B va aconseguir una separació perfecta amb AUC = 1,000, tot i que els autors ho tracten com un diagnòstic: a SD302b els parells aparellats són de resolució creuada, i un control de resolució coincident no va eliminar la puntuació perfecta, cosa que suggereix que podria tractar-se de detecció de quasi-duplicats (una mateixa captura renderitzada dues vegades).
A més, el benchmark inclou una sonda d'equitat sobre gènere, raça i edat que indica que les disparitats augmenten a mesura que la discriminació es debilita. Això té implicacions ètiques importants per al desplegament real de sistemes biomètrics basats en intel·ligència artificial.
Des d'una perspectiva tècnica, SLAPBench demostra que la fiabilitat d'un MLLM en verificació SLAP depèn tant de l'arquitectura del model com del disseny del prompt. La capacitat d'evitar col·lapses no és trivial: requereix un equilibri entre l'especificitat de la instrucció i la llibertat del model per interpretar la similitud. Això obre la porta a la investigació en enginyeria de prompts adaptatius i ajust fi amb dades biomètriques.
Per a les empreses que desenvolupen solucions d'identitat digital, aquest benchmark suposa una guia pràctica. Combinar la potència dels MLLMs amb sistemes d'intel·ligència artificial integrats en plataformes cloud pot accelerar l'adopció de verificacions sense contacte i amb alta precisió. Per exemple, una companyia de desenvolupament d'aplicacions a mida com Q2BSTUDIO pot dissenyar fluxos de verificació que utilitzin MLLMs com a part d'un pipeline d'autenticació, combinant-los amb tècniques de ciberseguretat per protegir les dades biomètriques i amb serveis cloud com AWS o Azure per escalar horitzontalment. A més, la integració d'agents IA permet automatitzar decisions d'accés en temps real, mentre que eines de BI com Power BI faciliten l'anàlisi de mètriques de rendiment i equitat.
Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entén que la innovació en biomètrica requereix un enfocament multidisciplinari. La verificació SLAP amb MLLMs no és només un exercici acadèmic: pot aplicar-se en control fronterer, compliment normatiu, banca digital i plataformes d'identitat descentralitzada. La capacitat d'integrar models com Claude o Qwen en aplicacions multiplataforma, amb backends en núvol i dashboards de BI, és clau per oferir solucions robustes i escalables.
El futur de la verificació biomètrica passa per benchmarks com SLAPBench, que exposen les fortaleses i debilitats dels models actuals. A mesura que sorgeixin nous MLLMs, serà necessari actualitzar aquestes avaluacions, afinar les estratègies de prompting i garantir que els sistemes siguin justos i segurs. Per a les organitzacions que busquen adoptar aquesta tecnologia, comptar amb un soci tecnològic que domini tant la intel·ligència artificial com la ciberseguretat i el núvol és un diferenciador competitiu. Q2BSTUDIO ofereix precisament aquesta combinació, ajudant empreses de totes les mides a implementar solucions de verificació d'identitat d'avantguarda.




