SLAPBench: primer benchmark de MLLM para huellas SLAP

Descubre SLAPBench, el primer benchmark que evalúa modelos multimodales en verificación de huellas SLAP. Resultados sorprendentes sobre prompts y rendimiento.

domingo, 26 de julio de 2026 • 4 min de lectura • Equipo Q2BSTUDIO

MLLM y verificación de huellas SLAP: un nuevo benchmark

La verificación de identidad mediante huellas dactilares es una de las tecnologías biométricas más extendidas, pero los sistemas tradicionales suelen enfrentarse a limitaciones de precisión, escalabilidad y adaptabilidad a contextos no controlados. Con el auge de los modelos multimodales de lenguaje grande (MLLMs), surge la posibilidad de abordar la autenticación desde una nueva perspectiva: interpretar imágenes completas de huellas SLAP (cuatro dedos de una mano en una sola captura plana) sin necesidad de entrenamiento específico. Sin embargo, hasta ahora no existía un marco de evaluación estandarizado para medir el rendimiento de estos modelos en esta tarea. SLAPBench llega para llenar ese vacío.

SLAPBench es el primer benchmark diseñado específicamente para evaluar la capacidad de los MLLMs en la verificación de identidad a partir de imágenes SLAP. Construido sobre el conjunto de datos NIST SD302b, incluye 7.832 pares de imágenes (176 emparejadas y 7.656 no emparejadas), lo que permite realizar pruebas exhaustivas tanto de falsa aceptación como de falsa negación. El estudio original evaluó cuatro modelos open-source (InternVL3-8B, Qwen2.5-VL-7B, Qwen3-VL-8B y Gemma-3-12B) junto con el propietario Claude Opus 4.8, utilizando diferentes estrategias de prompting: zero-shot, descripción de tarea y puntuación de similitud.

Los resultados revelan que el prompting gobierna el comportamiento del modelo en términos de colapso (tasa de falsa aceptación cercana al 100%), mientras que la capacidad del modelo determina la discriminación real. Bajo prompting de descripción de tarea, todos los modelos open-source colapsaron; Gemma-3-12B también colapsó en zero-shot. Solo Claude Opus 4.8 resistió el colapso en ambos prompts binarios, logrando una FAR del 20,2%. En cambio, al usar puntuación de similitud, los modelos open-source dejaron de colapsar y se expusieron diferencias profundas: Claude alcanzó un AUC de 0,953, Gemma-3-12B 0,837, InternVL3-8B obtuvo un resultado invertido (0,590) y Qwen2.5-VL-7B fue casi aleatorio (0,567). Sorprendentemente, Qwen3-VL-8B consiguió una separación perfecta con AUC = 1,000, aunque los autores lo tratan como un diagnóstico: en SD302b los pares emparejados son de resolución cruzada, y un control de resolución coincidente no eliminó la puntuación perfecta, lo que sugiere que podría tratarse de detección de casi-duplicados (una misma captura renderizada dos veces).

Además, el benchmark incluye una sonda de equidad sobre género, raza y edad que indica que las disparidades aumentan a medida que la discriminación se debilita. Esto tiene implicaciones éticas importantes para el despliegue real de sistemas biométricos basados en inteligencia artificial.

Desde una perspectiva técnica, SLAPBench demuestra que la fiabilidad de un MLLM en verificación SLAP depende tanto de la arquitectura del modelo como del diseño del prompt. La capacidad de evitar colapsos no es trivial: requiere un equilibrio entre la especificidad de la instrucción y la libertad del modelo para interpretar la similitud. Esto abre una puerta a la investigación en ingeniería de prompts adaptativos y ajuste fino con datos biométricos.

Para las empresas que desarrollan soluciones de identidad digital, este benchmark supone una guía práctica. Combinar la potencia de los MLLMs con sistemas de inteligencia artificial integrados en plataformas cloud puede acelerar la adopción de verificaciones sin contacto y con alta precisión. Por ejemplo, una compañía de desarrollo de aplicaciones a medida como Q2BSTUDIO puede diseñar flujos de verificación que utilicen MLLMs como parte de un pipeline de autenticación, combinándolos con técnicas de ciberseguridad para proteger los datos biométricos y con servicios cloud como AWS o Azure para escalar horizontalmente. Además, la integración de agentes IA permite automatizar decisiones de acceso en tiempo real, mientras que herramientas de BI como Power BI facilitan el análisis de métricas de rendimiento y equidad.

Q2BSTUDIO, como empresa de desarrollo de software y tecnología, entiende que la innovación en biometría requiere un enfoque multidisciplinar. La verificación SLAP con MLLMs no es solo un ejercicio académico: puede aplicarse en control fronterizo, cumplimiento normativo, banca digital y plataformas de identidad descentralizada. La capacidad de integrar modelos como Claude o Qwen en aplicaciones multiplataforma, con backends en cloud y dashboards de BI, es clave para ofrecer soluciones robustas y escalables.

El futuro de la verificación biométrica pasa por benchmarks como SLAPBench, que exponen las fortalezas y debilidades de los modelos actuales. A medida que surjan nuevos MLLMs, será necesario actualizar estas evaluaciones, afinar las estrategias de prompting y garantizar que los sistemas sean justos y seguros. Para las organizaciones que buscan adoptar esta tecnología, contar con un socio tecnológico que domine tanto la inteligencia artificial como la ciberseguridad y la nube es un diferenciador competitivo. Q2BSTUDIO ofrece precisamente esa combinación, ayudando a empresas de todos los tamaños a implementar soluciones de verificación de identidad de vanguardia.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.