En l'ecosistema de compiladors d'intel·ligència artificial, MLIR (Multi-Level Intermediate Representation) s'ha consolidat com una peça fonamental. Frameworks com TensorFlow, JAX, PyTorch Inductor i IREE depenen de MLIR per transformar i optimitzar models de forma eficient. No obstant això, l'adopció de MLIR en l'entrenament de models de llenguatge especialitzats en codi (code-LM) ha estat mínima: amb prou feines apareixen rastres del llenguatge en els corpus de preentrenament. A més, MLIR és extensible per disseny: cada domini d'aplicació introdueix nous dialectes, cosa que fa que un model fine-tunejat per dialecte no sigui escalable. Davant d'aquest repte, un equip d'investigadors ha plantejat una alternativa innovadora: utilitzar restriccions derivades mecànicament de l'especificació de definició d'operacions (ODS) de cada dialecte com a priori en temps d'inferència, en lloc d'adaptació basada en gradients. Aquest enfocament no només promet generalització entre dialectes sense reentrenament, sinó que també obre la porta a aplicacions pràctiques on l'eficiència i la flexibilitat són crítiques.
Per validar la proposta, s'han llançat quatre benchmarks que cobreixen tres dialectes: MLIR-Spec-150, Linalg-Spec-30, StableHLO-Spec-30 i StableHLO-Held-Out-200. En total, sumen 410 parells de llenguatge natural a MLIR, més un conjunt de tensió fora de gramàtica de 25 programes i un conjunt de referència funcional de 30 programes escrits a mà. Tot el material es publica sota llicència Apache-2.0, acompanyat de fitxes tècniques a l'estil Gebru i metadades Croissant 1.0. Aquest repositori permet a la comunitat reproduir els experiments i avaluar la capacitat de generalització dels models.
El cor tècnic del treball és una pila de restriccions de tres capes derivades de l'esquema del dialecte. La primera capa (C1) construeix un graf de flux de control sobre les signatures de les operacions. La segona (C2) extreu un reticle de tipus a partir de l'ODS i defineix particions sobre dominis de tipus. La tercera (C3) és un validador d'abast SSA que implementa un mostreig per rebuig amb fins a cinc reintents. El més interessant és que portar aquesta pila des de dialectes com arith+func+memref+linalg a StableHLO no va requerir escriure ni una línia de codi nou per a les capes de restricció. Això demostra que l'arquitectura és realment extensible i reutilitzable.
Els resultats experimentals són reveladors. En dialectes on la semàntica del verificador està dominada per restriccions estructurals —com linalg—, el model petit SmolLM2-1.7B, alimentat amb aquests priors estructurals, aconsegueix un 80,0% de generacions vàlides (mitjana de tres llavors, n=125). Aquesta xifra supera en 21 a 44 punts percentuals a models molt més grans com CodeLlama-34B, Granite-Code-34B i StarCoder2-15B, amb intervals de confiança no solapats. En canvi, en dialectes com arith+func o en el conjunt StableHLO-Held-Out-200, on la semàntica del verificador depèn de valors d'atributs i no de l'estructura, aquests mateixos models grans igualen o superen el model petit. Els autors reconeixen aquestes cel·les com 'no guanyadores' i les acoten clarament en la seva anàlisi.
Aquest estudi té implicacions profundes per al desenvolupament de programari d'IA. D'una banda, demostra que no sempre és necessari escalar models o invertir en costosos reentrenaments per aconseguir resultats competitius en tasques de generació de codi de compilació. De l'altra, posa de relleu la importància d'aprofitar el coneixement de domini —en aquest cas, l'estructura formal de MLIR— per guiar models més lleugers. En un context empresarial, on l'eficiència computacional i la velocitat d'inferència són avantatges competitius, aquest tipus de tècniques pot marcar la diferència.
Des de la perspectiva d'una empresa tecnològica com Q2BSTUDIO, aquestes innovacions encaixen perfectament amb la nostra oferta de serveis. Ens especialitzem en el desenvolupament d'aplicacions a mida per a entorns que requereixen integració d'intel·ligència artificial, ja sigui en l'automatització de processos, en l'optimització de pipelines de dades o en la implementació de models de llenguatge. La capacitat de generalitzar entre dialectes MLIR sense reentrenament redueix la necessitat de recursos hardware i accelera els cicles de desplegament, una característica que valoren especialment els nostres clients que treballen amb infraestructures cloud com AWS o Azure.
A més, la seguretat en aquests sistemes és crítica. Si un model d'IA genera codi MLIR defectuós, podria comprometre la integritat dels compiladors i, per tant, de les aplicacions finals. Per això, a Q2BSTUDIO oferim serveis de ciberseguretat orientats a protegir pipelines d'IA, incloent-hi auditories de codi i proves de penetració (pentesting) sobre entorns de compilació. Així mateix, la monitorització d'aquests sistemes mitjançant eines de Business Intelligence (BI) com Power BI permet a les organitzacions visualitzar mètriques de rendiment, taxes d'error i eficiència dels models, facilitant la presa de decisions basada en dades.
L'aparició d'agents d'IA capaços de generar codi de compilació de forma autònoma és una altra tendència que estem incorporant en els nostres desenvolupaments. Aquests agents, combinats amb tècniques de priorització estructural com les descrites, poden convertir-se en assistents intel·ligents per a enginyers de programari, reduint dràsticament el temps de desenvolupament de nous dialectes o d'adaptació de models a maquinari específic. A Q2BSTUDIO, creiem que la convergència entre compilació intel·ligent, cloud computing i automatització és el camí cap a la propera generació d'eines de desenvolupament.
En resum, el treball de generalització entre dialectes MLIR sense reentrenament representa un avenç significatiu en l'eficiència dels models de llenguatge aplicats a compilació. La combinació de benchmarks oberts, restriccions derivades d'esquemes i models lleugers ofereix un full de ruta pràctic per millorar l'escalabilitat dels sistemes d'IA. Per a les empreses que busquen adoptar aquestes tecnologies, comptar amb un soci tecnològic com Q2BSTUDIO, amb experiència en aplicacions a mida, intel·ligència artificial, ciberseguretat i cloud, és la clau per transformar la innovació en resultats tangibles.




