Resum: En aquest article explico com vam construir un model de reconeixement d'expressions facials amb PyTorch sobre el dataset FER-2013 i vam assolir al voltant del 72% d'exactitud en validació. La intenció va ser aconseguir una solució reproduïble i eficient per a inferència en temps real, pensant en desplegaments en serveis cloud AWS i Azure i aplicacions a mida.
Introducció: FER-2013 és un dataset realista amb imatges en escala de grisos de 48x48 i fort desequilibri entre classes. Els reptes principals són baixa resolució, soroll en les etiquetes i variabilitat intraclasse. Tot i això, una arquitectura compacta i bones tècniques d'augmentació permeten obtenir resultats sòlids per a solucions d'IA per a empreses.
Preprocessament i augmentació: Per a l'entrenament apliquem transformacions habituals: conversió a imatge PIL, flip horitzontal aleatori, petites rotacions fins a 10 graus, retall i redimensionament a 48x48, normalització amb mitjana i desviació típica adequades. En validació només redimensionament i normalització. Aquestes transformacions ajuden a generalitzar i són compatibles amb pipelines en producció i amb serveis d'inferència al núvol.
Arquitectura del model: Vam dissenyar una CNN de 3 blocs. Entrada 48x48x1. Bloc 1: Conv 3x3 64 filtres, BatchNorm, ReLU, MaxPool 2x2 produeix 24x24x64. Bloc 2: Conv 3x3 128 filtres, BatchNorm, ReLU, MaxPool 2x2 produeix 12x12x128. Bloc 3: Conv 3x3 256 filtres, BatchNorm, ReLU, MaxPool 2x2 produeix 6x6x256. Dropout2d 0.25, aplanament a 9216, FC a 512, ReLU, Dropout 0.5 i sortida FC de 7 neurones amb softmax en inferència. Aquesta topologia equilibra capacitat i eficiència per a inferència en temps real i desplegaments edge o en serveis cloud.
Recepta d'entrenament: Pèrdua CrossEntropyLoss, optimitzador AdamW amb lr 1e-3 i weight decay 1e-4, scheduler ReduceLROnPlateau o CosineAnnealingLR. Mida de batch 64, nombre d'èpoques entre 30 i 60 amb early stopping i paciència 7 sobre la pèrdua de validació. Guardem el millor checkpoint per mètrica F1 macro o per pèrdua de validació.
Reproduïbilitat i bones pràctiques: Fixem llavors per a random, numpy i torch i configurem cudnn deterministic False o True segons necessitats per equilibrar reproduïbilitat i rendiment. Registrem mètriques per època, matriu de confusió i F1 per classe per entendre errors i classes amb pitjor rendiment.
Avaluació i resultats: A més de l'exactitud global en validació propera al 72% reportem matriu de confusió i F1 per classe per mesurar sensibilitat en emocions com ira, fàstic, por, felicitat, tristesa, sorpresa i neutral. Aquests indicadors són clau quan s'integra el model en solucions de negoci on cada classe té diferent valor.
Desplegament i següents passos: El model es pot adaptar a inferència en temps real amb webcam, integrar-se en una API amb Django o Flask, o desplegar-se en serveis cloud AWS i Azure usant contenidors i endpoints gestionats per escalat. Altres millores inclouen fine tuning amb models preentrenats, pruning, quantization i pipelines de detecció de cara per a preprocessament robust.
Sobre Q2BSTUDIO: Q2BSTUDIO és una empresa de desenvolupament de programari i aplicacions a mida especialitzada en intel·ligència artificial, ciberseguretat, serveis cloud AWS i Azure, serveis d'intel·ligència de negoci i solucions personalitzades. Oferim programari a mida, aplicacions a mida, consultoria en intel·ligència artificial i IA per a empreses, desenvolupament d'agents IA, integracions amb Power BI i solucions d'intel·ligència de negoci per transformar dades en valor. Si busques una solució clau en mà per a reconeixement facial, desplegament al núvol o integració amb sistemes corporatius, el nostre equip pot ajudar-te a portar el prototip a producció amb pràctiques de seguretat i escalabilitat.
Contacte i col·laboració: Si desitges adaptar aquest projecte a un cas real, integrar models en productes, desenvolupar programari a mida o contractar serveis de ciberseguretat, serveis cloud AWS i Azure, agents IA o Power BI, posa't en contacte amb Q2BSTUDIO. Podem oferir proves de concepte, pipelines de MLOps i desplegament segur perquè el teu projecte aprofiti la intel·ligència artificial de manera responsable i eficient.



