La capacitat d'un sistema intel·ligent per identificar en una imatge quines zones són aptes per realitzar una acció concreta —obrir una porta, agafar un objecte, seure en una cadira— es coneix com a groundat d'affordances. Aquesta habilitat és fonamental en robòtica, realitat augmentada i sistemes autònoms, però ha estat tradicionalment complexa d'implementar per l'ambigüitat visual de les imatges i la similitud semàntica entre accions. Recents avenços en models de llenguatge i visió de gran escala (LVLMs) han demostrat que els seus mapes d'atenció interns codifiquen informació espacial implícita, fins i tot quan el model només genera text. Investigadors han desenvolupat un enfocament nou que selecciona, entre tots els tokens de sortida, aquell el mapa d'atenció del qual s'activa dominantment sobre l'objecte rellevant, transformant aquest senyal semàntic en mapes de calor d'affordance sense necessitat d'entrenament supervisat. Aquest mètode, anomenat TokAG, supera en precisió enfocaments previs basats en aprenentatge feblement supervisat, aconseguint millores significatives en benchmarks com AGD20K i HICO-IIF.
L'aplicació pràctica d'aquesta tecnologia va més enllà del laboratori: empreses que desenvolupen ia per a empreses poden integrar el groundat d'affordances en sistemes d'inspecció visual, assistents robòtics o interfícies de realitat mixta. A Q2BSTUDIO oferim aplicacions a mida que incorporen capacitats de percepció avançada, combinant intel·ligència artificial amb serveis cloud com aws i azure per escalar solucions de forma segura. També proveïm serveis cloud aws i azure que faciliten el desplegament de models de visió i llenguatge, així com serveis intel·ligència de negoci per analitzar les dades generades per aquests sistemes. La nostra experiència en ciberseguretat garanteix que les solucions siguin robustes davant d'amenaces. Així, el groundat d'affordances basat en tokens es converteix en una eina pràctica i accessible per a qualsevol organització que busqui dotar els seus agents IA d'una comprensió espacial més precisa i eficient.





