Nemotron-Labs-3-Puzzle-75B-A9B: LLM MoE comprimit amb 2x rendiment

El Nemotron-3 comprimit de NVIDIA ofereix 2,03x més rendiment. Manté precisió amb 75,3B paràmetres gràcies a Puzzle iteratiu.

jueves, 30 de julio de 2026 • 6 min de lectura • Equip Q2BSTUDIO

Modelo híbrido Mamba-Transformer optimizado para inferencia

El panorama dels models de llenguatge grans (LLMs) està experimentant una transformació silenciosa però profunda: l'eficiència en la inferència s'ha convertit en un factor tan crític com la precisió. En aquest context, el llançament de Nemotron-Labs-3-Puzzle-75B-A9B per part de l'equip d'NVIDIA AI representa una fita en la compressió de models híbrids MoE (Mixture of Experts). Aquest model, que redueix els paràmetres totals de 120,7B a 75,3B i els actius de 12,8B a 9,3B, duplica el rendiment del servidor mantenint una qualitat competitiva. Més enllà de les xifres, el que és interessant és com aquesta tecnologia obre noves possibilitats per a empreses que busquen aplicacions a mida amb intel·ligència artificial d'alt rendiment sense disparar els costos d'infraestructura.

Per entendre el salt, cal recordar que Nemotron-3-Super, el model pare, ja era un referent per la seva combinació de capes Mamba, atenció i MoE. No obstant, servir centenars d'usuaris amb baixes latències requeria nodes massius. El nou Puzzle-75B-A9B manté la mateixa arquitectura de 88 blocs (40 Mamba, 40 MoE, 8 d'atenció) però redissenya l'interior de cada bloc. Els experts enrutats es redueixen de manera heterogènia: mentre que al model original cada token podia activar fins a 22 experts amb una mida intermèdia de 2688 canals, aquí el nombre varia per capa (entre 4 i 18) i la mida dels experts es comprimeix a una mitjana del 59,9%. L'estat SSM de Mamba passa de 128 a 96 canals. La clau és que la poda no és uniforme: les capes intermèdies i finals conserven més capacitat, mentre que les primeres es redueixen dràsticament. Aquest procés, anomenat 'Puzzle iteratiu', alterna compressió amb recuperació mitjançant destil·lació de coneixement, aconseguint una mitjana de 69,05 punts en deu benchmarks enfront dels 68,48 d'una compressió directa.

Els resultats en rendiment són cridaners. En un node 8xB200 amb pesos NVFP4 i memòria cau KV FP8, el throughput total augmenta entre 1,60x i 2,14x depenent del règim de prefix/decode. Per exemple, en l'escenari 8K/64K (context curt i generació llarga) amb almenys 100 tokens/segon per usuari, es passa de 20.939 a 42.601 tokens per segon. En un sol H100, la concurrència amb context d'1M de tokens salta d'1 a 8 gràcies a la reducció de pesos de 70 GB a 44,5 GB. Això permet, per exemple, executar simultàniament vuit peticions d'anàlisi documental d'1M de tokens en una sola GPU, multiplicant per quatre el throughput agregat de descodificació. Per a empreses que processen grans volums de documents o que ofereixen assistents de codificació interactius, això es tradueix en una reducció significativa de costos d'infraestructura cloud.

On es paguen els peatges? Les avaluacions mostren caigudes en tasques de seguiment d'instruccions (Arena-Hard-V2: -4,2 punts) i en benchmarks agentius com SWE-Bench (-2,6). No obstant, les capacitats de context llarg es mantenen gairebé intactes (RULER 1M només baixa 1,7 punts). Això suggereix que el model comprimit és ideal per a tasques que requereixen processar documents llargs, com sistemes de RAG (Retrieval-Augmented Generation) o agents que interactuen amb bases de coneixement extenses. També resulta prometedor per a aplicacions d'IA incrustada en processos de negoci, on la latència i el cost per consulta són determinants.

Des d'una perspectiva empresarial, la compressió de models com aquest encaixa perfectament amb la tendència de desplegaments híbrids cloud+edge. Una empresa que desenvolupi aplicacions a mida per als seus clients pot ara integrar un LLM d'alt rendiment en un sol servidor, reduint la dependència de clústers costosos. Serveis com cloud AWS/Azure se'n beneficien directament: en necessitar menys GPUs per al mateix throughput, els costos operatius baixen i l'elasticitat millora. A més, la possibilitat d'executar vuit peticions simultànies d'1M de tokens en un H100 obre la porta a agents IA que processen múltiples documents en paral·lel, fonamental en sectors com l'assessoria legal, la investigació farmacèutica o l'auditoria financera.

En l'àmbit de la ciberseguretat, un model comprimit implica menys superfície d'atac i menor consum energètic, però també exigeix reentrenar els sistemes de detecció d'anomalies si s'utilitzen embeddings generats per l'LLM. Per a companyies que ofereixen Business Intelligence amb Power BI, la integració d'un model de llenguatge lleuger permet generar informes narratius en temps real a partir de grans conjunts de dades sense saturar el servidor. Un escenari típic: un dashboard interactiu que utilitza un agent LLM per respondre preguntes en llenguatge natural sobre vendes mensuals, recolzat en BI/Power BI i desplegat en cloud AWS/Azure. Amb el Puzzle-75B-A9B, aquest agent pot atendre vuit usuaris simultàniament amb baixa latència, cosa que abans requeria múltiples instàncies.

El procés de compressió no és trivial. NVIDIA va emprar una cerca d'arquitectura neuronal descomposta (Puzzletron) que defineix un espai d'alternatives per a cada capa i resol un programa mixt-entir per escollir la combinació òptima sota restriccions de memòria i computació. Després, tres etapes de compressió (MoE al 75%, Mamba al 75%, després MoE al 60% i finalment pressupost d'experts al 50%) s'intercalen amb fases de destil·lació de coneixement que sumen fins a 120B tokens. La recuperació final inclou un pipeline de RL (aprenentatge per reforç) centrat en enginyeria de programari, tot i que l'impacte d'aquesta fase va ser modest. Un detall rellevant: el model hereta un capçal de predicció multi-token (MTP) del pare, i es va identificar un desajust entrenament-inferència que es va corregir amb entrenament continu, elevant la longitud d'acceptació mitjana de 3,45 a 4,34 a SPEED-Bench.

La quantització també juga un paper clau. S'ofereixen checkpoints en BF16, FP8 i NVFP4. Aquest últim, dissenyat per a Blackwell, redueix els pesos a 4 bits, ocupant només 44,5 GB en un H100. Tot i que NVFP4 no és natiu a Hopper, s'utilitza perquè la memòria HBM és el coll d'ampolla. Sorprenentment, el checkpoint NVFP4 gairebé no degrada respecte al BF16 en la majoria de benchmarks; fins i tot millora a RULER 1M (93,2 vs 92,2). Això demostra que la compressió i la quantització poden ser complementàries quan s'apliquen amb cura.

Per a una empresa de desenvolupament de programari com Q2BSTUDIO, aquests avenços representen una oportunitat per oferir solucions més eficients i escalables als seus clients. Imaginem un sistema d'atenció al client basat en agents IA que necessita gestionar converses de fins a 1M de tokens (historial complet d'interaccions). Amb el model comprimit, un sol H100 pot servir vuit clients simultàniament, reduint els costos de servidor en un 75% en comparació amb el model original. O pensem en una plataforma d'anàlisi de contractes legals que ha de processar milers de pàgines per minut: l'augment de throughput en el règim 8K/64K permet duplicar la capacitat sense afegir maquinari. Són casos d'ús on la compressió no és un luxe, sinó una necessitat per a la viabilitat econòmica del projecte.

En conclusió, Nemotron-Labs-3-Puzzle-75B-A9B demostra que és possible reduir dràsticament els requisits de memòria i computació d'un LLM híbrid MoE sense sacrificar les capacitats essencials de context llarg i raonament. Per a les empreses que busquen integrar IA generativa d'alt nivell en les seves aplicacions a mida, aquest model ofereix un punt de partida excel·lent. Ja sigui desplegat en cloud AWS/Azure, combinat amb BI/Power BI per a anàlisis en temps real, o com a base d'agents IA autònoms, la seva eficiència democratitza l'accés a la intel·ligència artificial de frontera. El camí cap a models més lleugers i ràpids tot just comença, i aquest puzzle és una peça clau.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.