L’anàlisi del comportament afectiu en entorns no controlats ha assolit una nova fita amb l’onzena edició del concurs Affective Behavior Analysis in-the-Wild (ABAW 11). Aquest esdeveniment, que impulsa la investigació en reconeixement d’emocions, expressió facial i unitats d’acció, ha vist com equips com HSEmotion presenten solucions que combinen eficiència computacional i precisió. En aquest article explorem les claus tècniques de la seva proposta, centrada en l’aprenentatge multitasca i la detecció d’ambivalència, i les connectem amb el desenvolupament d’aplicacions empresarials avançades. Des de la perspectiva de Q2BSTUDIO, empresa especialitzada en aplicacions a mida, aquestes innovacions obren la porta a sistemes d’IA més lleugers, segurs i adaptables al món real.
La competició ABAW 11 s’estructura en dues grans tasques. La primera és l’aprenentatge multitasca sobre el conjunt de dades s-Aff-Wild2, on s’han de predir simultàniament valència, arousal, expressions facials i unitats d’acció. La segona tasca se centra en el reconeixement de vídeos d’ambivalència o hesitació sobre el conjunt de dades BAH ampliat. En ambdós casos, l’equip HSEmotion ha demostrat que és possible aconseguir un rendiment competitiu sense recórrer a models pesats ni a un ajust fi de backbones complets. La seva estratègia es basa en extractors facials lleugers congelats (MT-EmotiDDAMFN i MT-EmotiEffNet-B0), caps separats per tasca i un post-processat sistemàtic que inclou suavització gaussiana temporal, ajust de biaix per expressió, mescla amb AffectNet, optimització de llindars per unitat d’acció i fusió ponderada de backbones. Segons els resultats oficials, aquest enfocament supera significativament la línia base de ConvNeXt en el conjunt de validació.
Per a la detecció d’ambivalència, el pipeline audiovisual s’estén a nivell de vídeo mitjançant fusió tardana de classificadors de cara, àudio (HuBERT) i text (RoBERTa), agregació temporal i una porta de text global. El resultat és un augment del Weighted F1 a nivell de fotograma de 0,74 a 0,79 respecte a l’edició anterior (ABAW-8), i un Macro F1 a nivell de vídeo de 0,73 en la prova pública. Aquestes dades confirmen que la calibració sistemàtica de prediccions i la fusió multimodal lleugera poden rivalitzar amb enfocaments pesats d’extrem a extrem, oferint a més una major eficiència i flexibilitat de desplegament.
Des d’una òptica empresarial, aquestes tècniques tenen un impacte directe en el desenvolupament de solucions d’IA per a sectors com la salut mental, l’educació o l’atenció al client. La possibilitat d’executar models lleugers en dispositius perifèrics (edge computing) o al núvol sense consumir recursos excessius és clau per a aplicacions en temps real. A Q2BSTUDIO integrem aquests principis en els nostres projectes de aplicacions a mida, combinant intel·ligència artificial amb serveis al núvol com AWS o Azure per escalar solucions de forma segura. La ciberseguretat també hi té un paper fonamental: en processar dades biomètriques facials, és vital protegir la informació mitjançant xifrat i bones pràctiques de pentesting, quelcom que oferim des de la nostra àrea de ciberseguretat.
L’ús de models congelats i caps lleugers, tal com fa HSEmotion, és una tendència que s’alinea amb la necessitat empresarial de reduir costos computacionals sense sacrificar precisió. En lloc d’entrenar xarxes massives des de zero, es poden reutilitzar extractors preentrenats i ajustar únicament les capes específiques. Això accelera el temps de desenvolupament i permet iterar ràpidament sobre noves tasques. Per exemple, en un sistema d’anàlisi de sentiments en videoconferències, podríem emprar un extractor facial lleuger i afegir caps per detectar emocions, mirada o gestos, tot amb un post-processat similar al descrit. La combinació amb Business Intelligence (Power BI) permet visualitzar en temps real l’evolució de l’estat d’ànim dels participants, integrant dades d’àudio i text per enriquir l’anàlisi.
Un altre aspecte rellevant és la fusió multimodal. En el món empresarial, rarament es disposa d’un únic flux de dades. Les solucions efectives han de combinar imatges, so i text per obtenir una visió completa. El pipeline de HSEmotion per a ambivalència n’és un exemple perfecte: fusió tardana de tres modalitats amb agregació temporal. A Q2BSTUDIO apliquem principis similars en projectes d’automatització de processos i agents IA, on un assistent virtual pot entendre no només què diu l’usuari, sinó també com ho diu (to de veu) i la seva expressió facial. Això millora l’experiència de client i permet detectar estats de confusió o insatisfacció abans que es converteixin en problemes majors.
La calibració de prediccions és un altre punt diferencial. Molts models produeixen sortides poc calibrades, cosa que porta a falsos positius o negatius. L’equip HSEmotion aplica un post-processat acurat: suavització gaussiana per evitar canvis bruscos, ajust de biaix per equilibrar classes desbalancejades, i optimització de llindars per unitat d’acció. Aquestes tècniques són directament transferibles a sistemes de classificació empresarial, com la moderació de contingut o la detecció de frau. A Q2BSTUDIO ajudem els nostres clients a implementar tals estratègies dins de les seves plataformes, assegurant que els models no només siguin precisos, sinó també robustos i explicables.
L’eficiència computacional també és crítica per al desplegament al núvol. Utilitzar extractors congelats i conjunts lleugers redueix el consum d’instàncies d’AWS o Azure, disminuint els costos operatius. A més, l’arquitectura modular facilita l’actualització de components sense haver de reentrenar tot el sistema. Al nostre departament de cloud AWS/Azure, dissenyem pipelines que aprofiten aquests avantatges, oferint elasticitat i alta disponibilitat per a aplicacions de processament afectiu a gran escala.
Finalment, l’orientació a resultats de la competició ABAW 11 reflecteix una filosofia que compartim a Q2BSTUDIO: la innovació tècnica s’ha de traduir en valor tangible per al negoci. Ja sigui millorant la satisfacció del client, automatitzant la detecció d’emocions en entorns educatius o analitzant entrevistes de treball per identificar senyals d’ambivalència, les tècniques presentades per HSEmotion demostren que és possible aconseguir alta precisió sense necessitat d’inversions desmesurades en maquinari o temps d’entrenament. En un mercat on la velocitat i l’adaptabilitat són essencials, aquest enfocament lleuger i calibrat es converteix en un avantatge competitiu.
En conclusió, el treball de l’equip HSEmotion a ABAW 11 ofereix lliçons valuoses per a qualsevol organització que busqui integrar reconeixement d’emocions i anàlisi multimodal en les seves aplicacions. La combinació d’extractors lleugers, fusió de modalitats, post-processat sistemàtic i avaluació rigorosa forma una recepta que es pot replicar en projectes de software a mida, intel·ligència artificial, ciberseguretat i cloud computing. A Q2BSTUDIO estem preparats per ajudar les empreses a adoptar aquestes tecnologies, adaptant-les a les seves necessitats específiques i garantint un desplegament eficient i segur. El futur de l’anàlisi afectiu a l’empresa no es troba en models colossals, sinó en solucions intel·ligents, lleugeres i ben calibrades.




