EgoSafetyBench: avalua els VLM com a guardians de seguretat en robots

EgoSafetyBench: benchmark de 1.200 vídeos per avaluar VLM com a guardians de seguretat. Detecten perills reals o són enganyats?

jueves, 2 de julio de 2026 • 2 min de lectura • Equip Q2BSTUDIO

Diagnòstic de VLM com a guardians de seguretat robòtica

La irrupció de robots autònoms en entorns industrials i domèstics planteja un desafiament crític: com garantir que actuïn de manera segura sense generar falses alarmes que paralitzin processos productius. Els models de visió-llenguatge (VLM) s'han proposat com a guardians de seguretat en temps real, però els benchmarks tradicionals, en catalogar escenes com a segures o perilloses de forma binària, no capturen la complexitat de situacions ambigües. Aquí sorgeix EgoSafetyBench, un conjunt de dades egocèntric amb 1.200 vídeos anotats a nivell de mig segon, dissenyat per avaluar la capacitat d'aquests sistemes per identificar moments realment crítics sense reaccionar davant aparences enganyoses.

El benchmark es divideix en dues pistes. La primera abasta 800 escenaris situacionals que van des de rutines segures fins a perills contextuals, passant per accions sospitoses però innòcues. La segona, amb 400 escenaris, se centra en senyals visuals enganyoses (cartells, etiquetes, avisos) que poden distorsionar la percepció de seguretat física. Cada escenari inclou una parella contrastiva on només canvia un detall visible determinant, obligant el model a recolzar-se en aquesta pista i no en el context global. Els resultats revelen que, tot i que els VLM detecten correctament vídeos amb perill, fallen en identificar l'instant exacte del risc, especialment en perills contextuals. Més greu encara: les senyals enganyoses degraden el rendiment de tots els models provats; alguns passen per alt fins a un terç dels perills, mentre que altres intervenen excessivament en escenes segures, confonent robustesa aparent amb una tendència a alarmar indiscriminadament.

Aquesta troballa subratlla la necessitat d'enfocaments més sofisticats per a la supervisió autònoma. A Q2BSTUDIO entenem que la seguretat robòtica no pot dependre de classificacions binàries o de models que reaccionin a soroll visual. Per això oferim ia per a empreses que combina visió per computador, processament de llenguatge natural i raonament contextual, integrat en aplicacions a mida que es despleguen en entorns industrials reals. Els nostres agents IA estan entrenats per discriminar entre senyals genuïnes i enganyoses, utilitzant serveis cloud aws i azure per escalar el processament en temps real. A més, la ciberseguretat d'aquests sistemes es reforça mitjançant auditories contínues, i les dades de rendiment es visualitzen amb power bi per oferir quadres de comandament que permetin als supervisors humans identificar patrons de falsos positius o negatius.

El camí cap a robots veritablement segurs passa per benchmarks com EgoSafetyBench, però també pel desenvolupament de programari a mida que incorpori lògica de decisió robusta, entrenament adversarial i capacitat d'explicar les seves decisions. Els nostres serveis intel·ligència de negoci ajuden les empreses a mesurar l'impacte real d'aquests sistemes, ajustant llindars d'intervenció segons el context operatiu. La seguretat robòtica no és un problema binari; és un repte d'enginyeria que requereix una combinació de visió, llenguatge, raonament i desplegament cloud. A Q2BSTUDIO treballem perquè la intel·ligència artificial no només detecti perills, sinó que entengui quan intervenir i quan deixar que el robot continuï la seva tasca.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.