En el vast univers de la intel·ligència artificial, la majoria dels models multimodals s'han centrat en el que veiem i sentim, deixant de banda un dels sentits més complexos i evocadors: l'olfacte. No obstant això, un camp emergent està demostrant que és possible ensenyar a les màquines a interpretar aromes a partir d'imatges, utilitzant el llenguatge com a pont semàntic. Aquest enfocament, exemplificat per arquitectures com SCENT, obre la porta a aplicacions que van des de la realitat augmentada fins a la monitorització ambiental, passant per la creació d'experiències sensorials immersives. La clau rau en que les imatges per si soles no basten: necessiten context lingüístic per desentranyar quines olors podrien estar associades a una escena, ja siguin les d'un cafè acabat de fer, l'ozó després d'una tempesta o l'aroma d'un bosc humit.
La investigació subratlla un punt fonamental: les olors no sempre són visibles en els píxels, sinó que depenen de factors contextuals i ambientals. Per abordar aquest repte, s'empren models de llenguatge i visió (VLMs) que generen descriptors d'escena rics en semàntica. Aquests descriptors no només anomenen objectes, sinó que també infereixen olors plausibles i condicions de l'entorn. A partir d'aquí, un codificador olfactiu aprèn a alinear els senyals de nassos electrònics amb aquest espai de representació compartit, aconseguint descompondre mescles complexes en components específics i contextuals. Aquest avenç no només permet recuperar imatges a partir d'una olor, sinó també generar descripcions textuals d'un aroma sense necessitat de sensors físics.
Per a les empreses que volen explorar aquestes fronteres tecnològiques, comptar amb un soci que domini tant la ia per a empreses com el desenvolupament de solucions personalitzades resulta imprescindible. A Q2BSTUDIO oferim aplicacions a mida que integren intel·ligència artificial, serveis cloud aws i azure i capacitats de serveis intel·ligència de negoci com Power BI, tot això recolzat per una sòlida arquitectura de ciberseguretat. Els nostres agents IA i sistemes de intel·ligència artificial poden adaptar-se a dominis tan diversos com l'agroindústria, la perfumeria o la salut, on la combinació de visió, llenguatge i olfacte obre noves vies d'anàlisi i automatització.
Des d'una perspectiva tècnica, la descomposició latent guiada per llenguatge que proposen aquestes investigacions permet interpretar mescles d'olors de forma similar a com un sommelier descriu un vi: separant notes fructíferes, minerals o florals que provenen de diferents fonts. Aquesta capacitat resulta especialment valuosa en sectors on la qualitat de l'aire, la detecció de fuites o l'autenticació de productes depenen de signatures olfactives. L'alineació entre sensors electrònics, text i imatge no només millora la recuperació d'informació —com es demostra en tasques de smell-to-image i smell-to-text—, sinó que proporciona una base per construir sistemes de raonament multiespectral.
El camí cap a una intel·ligència artificial realment multimodal passa per integrar tots els canals sensorials, i l'olfacte ha estat fins ara el gran oblidat. Amb enfocaments com SCENT, i recolzant-nos en el programari a mida que desenvolupem a Q2BSTUDIO, és possible construir plataformes que no només vegin i entenguin, sinó que també olorin el món. Això té implicacions directes en la creació d'entorns virtuals immersius, en la monitorització de processos industrials i en la personalització d'experiències d'usuari basades en el context olfactiu. La tecnologia ja està llesta; només cal l'enfocament adequat per capturar allò que les imatges no expliquen.

.jpg)


