L'entrenament de models de llenguatge basats en mescla d'experts (MoE) ha revolucionat la intel·ligència artificial, però el seu cost computacional continua sent un repte. L'estat de l'optimitzador, que emmagatzema moments de primer i segon ordre, pot superar amb escreix el pes dels paràmetres. SkewAdam proposa una solució elegant: assignar l'estat de forma diferenciada segons el tipus de paràmetre —backbone dens, experts i router— aconseguint una reducció dràstica de memòria sense perdre precisió. Aquest avenç és especialment rellevant per a empreses com Q2BSTUDIO, especialitzada en el desenvolupament d'aplicacions a mida i solucions d'intel·ligència artificial, on l'eficiència en l'entrenament de grans models és crítica.
En l'article original es demostra que SkewAdam utilitza només 1,29 GB d'estat de l'optimitzador enfront dels 50,6 GB d'AdamW, cosa que redueix la memòria màxima d'entrenament de 81,4 GB a 31,3 GB. Això permet entrenar models MoE de 6,78B paràmetres en un sol accelerador de 40 GB. La clau està en tres nivells: el backbone (5% dels paràmetres) rep moment float32 més segon moment factoritzat; els experts (95%) només segon moment factoritzat; i el router (
La rellevància empresarial d'aquesta investigació és enorme. A Q2BSTUDIO entenem que l'optimització de recursos és vital per a projectes d'IA a gran escala. El nostre equip treballa amb clients que necessiten entrenar models propietaris amb pressupostos ajustats, i solucions com SkewAdam permeten reduir dràsticament els costos d'infraestructura cloud, ja sigui a AWS o Azure. A més, la capacitat de mantenir una alta precisió amb menys memòria obre la porta a implementacions en entorns amb recursos limitats, com sistemes encastats o dispositius edge, on la ciberseguretat i l'eficiència són prioritàries.
Des d'una perspectiva tècnica, el disseny de SkewAdam no és trivial. L'assignació per nivells es basa en l'anàlisi de les estadístiques de gradient de cada població de paràmetres. El backbone, que constitueix una fracció petita però crítica, requereix moments complets per convergir adequadament. Els experts, en ser nombrosos i compartir patrons, es poden beneficiar d'un segon moment factoritzat, similar al que utilitza Adafactor, però conservant el moment de primer ordre (momentum) que resulta essencial per a la precisió. El router, amb molt pocs paràmetres, es gestiona amb un segon moment exacte sense gaire impacte en la memòria.
L'estudi també inclou ablacions on es mostra que el guany en perplexitat no prové de la reducció de memòria en si, sinó de mantenir el momentum. De fet, si s'assigna el mateix estat de SkewAdam a tots els paràmetres (és a dir, es duplica l'estat), la perplexitat no millora, cosa que indica que els nivells són una manera d'estalviar memòria sense penalitzar la precisió. Això contrasta amb Adafactor, que en eliminar el momentum es queda 40 punts per darrere fins i tot amb taxes d'aprenentatge ajustades.
En el context de Q2BSTUDIO, aquestes lliçons s'apliquen directament als nostres serveis de Business Intelligence amb Power BI i desenvolupament d'agents IA. Per exemple, un sistema de recomanació basat en MoE entrenat amb SkewAdam podria executar-se en entorns cloud amb menys instàncies, reduint costos i facilitant la integració amb solucions de ciberseguretat. L'optimització de memòria també és clau per a aplicacions mòbils o web on el temps de resposta i el consum de recursos són crítics.
Un altre aspecte destacable és l'equilibri de càrrega del router. SkewAdam aconsegueix que la distribució de tokens entre experts es situï dins de l'1% del mínim uniforme, evitant colls d'ampolla i millorant la utilització del hardware. A Q2BSTUDIO valorem aquesta característica perquè els nostres projectes d'IA sovint requereixen sistemes escalables i robustos, on l'eficiència computacional es tradueix directament en estalvi econòmic.
Per a les empreses que busquen implementar models MoE, la recomanació és clara: avaluar optimitzadors com SkewAdam no només per la memòria que estalvien, sinó per la precisió que mantenen. El nostre equip a Q2BSTUDIO pot ajudar a adaptar aquestes tècniques a necessitats específiques, ja sigui desenvolupant programari a mida o integrant solucions cloud amb AWS i Azure. La ciberseguretat, l'analítica de dades i l'automatització són àrees on l'eficiència en l'entrenament de models fa la diferència.
En resum, SkewAdam representa un avenç significatiu en l'optimització de memòria per a MoE, demostrant que una assignació intel·ligent de l'estat de l'optimitzador pot ser tan important com la quantitat total de memòria. A Q2BSTUDIO seguim de prop aquestes innovacions per oferir als nostres clients les solucions més avançades en intel·ligència artificial, desenvolupament d'aplicacions i serveis cloud, sempre amb un enfocament en l'eficiència i la qualitat.





