L'evolució dels models de llenguatge de gran escala (LLMs) ha portat a arquitectures cada cop més complexes, com els Mixture-of-Experts (MoE). Aquestes arquitectures permeten escalar el nombre de paràmetres sense incrementar proporcionalment el cost computacional, però introdueixen nous reptes en l'aprenentatge per reforç (RL). Específicament, la generació de rollouts —les trajectòries que l'agent explora durant l'entrenament— es converteix en un coll d'ampolla a causa del gran nombre d'inferències necessàries. Per accelerar aquest procés, la indústria ha recorregut a la quantificació de baixa precisió, sent FP8 un estàndard recent. No obstant, formats com NVFP4 prometen un rendiment encara més gran en operar en precisió FP4 amb operacions GEMM natives W4A4.
NVFP4 combina un escalat fi que preserva la precisió amb un throughput superior al FP8, però la seva aplicació en RL per a MoE no és trivial. Els experiments revelen que l'entrenament col·lapsa després d'aproximadament 150 passos quan s'usa NVFP4 amb entrenament en BF16. Aquest col·lapse va acompanyat de bretxes creixents en la probabilitat logarítmica entre el rollout i l'entrenador, indicant una divergència en la representació de les distribucions. Una anàlisi detallada dels errors mostra que el problema no resideix en els pesos, sinó en les activacions. Els pesos es poden sincronitzar mitjançant un camí compartit de quantificació i decuantificació, mentre que les activacions es generen en línia i estan subjectes a la quadrícula gruixuda E2M1 de NVFP4, amplificant l'error.
Per abordar aquesta inestabilitat, s'ha proposat QUADS (Quantization-error Alignment across Dual Sides), un marc de treball que alinea l'error de quantificació en ambdós extrems del procés: l'entrenador i el generador de rollouts. QUADS consta de dos components principals. Primer, en el costat de l'entrenador, introdueix un entrenament amb consciència de quantificació asimètrica (Asymmetric QAT). En lloc de simular la quantificació total del model, aquesta tècnica quantifica només els pesos, deixant les activacions en precisió completa. Això permet que l'entrenador aprengui representacions alineades amb la quantificació real que ocorre durant la inferència del rollout, reduint la discrepància.
Segon, en el costat del rollout, QUADS aplica una Compensació Residual d'Activacions (Residual Activation Compensation). Durant la inferència, s'identifiquen els canals d'activació amb major error de quantificació i se'ls aplica una correcció residual, sense modificar l'operació GEMM nativa W4A4. Aquesta correcció és lleugera i no afecta el rendiment general, però estabilitza l'entrenament reduint l'error acumulat en les activacions. Els resultats en diversos benchmarks de RL per a MoE demostren que QUADS assoleix una precisió equivalent a BF16, millora el pass@1 en 21.49 punts respecte al NVFP4 naive, i ofereix un throughput de rollout aproximadament un 16% superior al FP8.
Aquests avenços no només són rellevants per a la recerca acadèmica, sinó que tenen un impacte directe en el desenvolupament de solucions d'intel·ligència artificial en entorns empresarials. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, ajudem les organitzacions a implementar aquestes tècniques optimitzades en les seves infraestructures. La nostra experiència en la creació d'aplicacions a mida ens permet adaptar algorismes de quantificació a les necessitats específiques de cada client, ja sigui per accelerar l'entrenament de models propietaris o per desplegar sistemes d'inferència en temps real.
L'adopció de QUADS i formats com NVFP4 té implicacions en múltiples àrees. Per exemple, en l'àmbit de la ciberseguretat, els models de detecció d'amenaces es poden beneficiar d'una inferència més ràpida i eficient, permetent respondre a incidents en mil·lisegons. Q2BSTUDIO ofereix serveis de pentesting i ciberseguretat que integren models optimitzats per protegir infraestructures crítiques. A més, la combinació amb plataformes de Business Intelligence com Power BI permet monitoritzar el rendiment d'aquests models en producció, identificant colls d'ampolla i ajustant estratègies d'escalat.
En el context de la computació al núvol, QUADS permet reduir el consum de recursos en plataformes com AWS o Azure. En requerir menys operacions d'alta precisió, els costos de càlcul disminueixen significativament, cosa que és especialment important per a startups i pimes que necessiten escalar sense pressupostos desmesurats. Q2BSTUDIO proporciona serveis cloud especialitzats en AWS i Azure, ajudant a desplegar infraestructures optimitzades per a càrregues de treball d'IA.
Un altre camp d'aplicació és el dels agents d'IA. Els assistents virtuals, chatbots i sistemes autònoms requereixen models que puguin generar respostes ràpidament i adaptar-se a contextos canviants. L'estabilitat en l'entrenament RL proporcionada per QUADS és crucial per desenvolupar agents que aprenguin de manera consistent sense col·lapsar. A Q2BSTUDIO dissenyem solucions d'agents intel·ligents personalitzats, integrant tècniques de quantificació per aconseguir un equilibri entre velocitat i precisió.
És important destacar que la implementació de QUADS no és un procés trivial. Requereix un coneixement profund de les arquitectures de hardware, com les GPUs que suporten FP4 natiu, així com dels detalls d'implementació dels kernels GEMM. Les empreses que desitgin adoptar aquestes tecnologies han de comptar amb un equip especialitzat o associar-se amb una consultora tecnològica. Q2BSTUDIO ofereix serveis de consultoria i desenvolupament en IA, cobrint des de la selecció del format de quantificació fins a la integració en pipelines d'entrenament i desplegament.
A més, la combinació de QUADS amb altres tècniques d'optimització, com la poda de models o la destil·lació del coneixement, pot generar sinergies importants. Per exemple, un model quantificat amb NVFP4 i estabilitzat amb QUADS pot ser posteriorment comprimit mitjançant poda per reduir encara més la seva empremta de memòria, mantenint la precisió. Aquestes estratègies formen part del portafoli de serveis de Q2BSTUDIO en automatització de processos i desenvolupament de programari a mida.
En el panorama competitiu actual, la capacitat d'entrenar i desplegar models MoE de manera eficient és un diferenciador clau. QUADS representa un avenç significatiu en l'estabilització del RL amb baixa precisió, i la seva adopció pot marcar la diferència entre un projecte d'IA que fracassa per inestabilitat i un que aconsegueix resultats d'última generació. A Q2BSTUDIO estem compromesos amb la innovació tecnològica, oferint solucions que abasten des de la consultoria inicial fins al manteniment continu de sistemes d'IA.
Per concloure, la integració de QUADS en els fluxos de treball de RL per a MoE no només resol el problema del col·lapse de l'entrenament amb NVFP4, sinó que obre el camí per a una nova generació de models més ràpids i eficients. Les empreses que inverteixen en intel·ligència artificial han de considerar aquestes tècniques com a part de la seva estratègia d'optimització. Amb el suport de socis com Q2BSTUDIO, és possible transformar la teoria en pràctica, reduint costos i accelerant el time-to-market. La intersecció de la quantificació avançada, el desenvolupament de programari a mida i els serveis cloud és on es forja el futur de la IA.





