El panorama de la intel·ligència artificial generativa avança a un ritme vertiginós, però l'eficiència en la implementació continua sent el gran repte per a les empreses que volen adoptar aquests models a gran escala. Recentment, l'equip de NVIDIA AI ha presentat Nemotron Labs 3 Puzzle 75B A9B, un model de llenguatge híbrid comprimit que duplica el rendiment del servidor respecte al seu predecessor Nemotron-3-Super. Aquest avenç no només és tècnicament rellevant, sinó que obre noves possibilitats per al desplegament d'agents d'IA, assistents de programació i sistemes de recuperació d'informació amb context ultra llarg, tot en maquinari assequible com una sola GPU H100 o un node B200.
Nemotron-3-Super és un model MoE (Mixture of Experts) híbrid que combina blocs Mamba, atenció i MoE, amb 120.700 milions de paràmetres totals i 12.800 milions actius per token. La seva versió comprimida, Puzzle-75B-A9B, redueix els paràmetres totals a 75.300 milions i els actius a 9.300 milions, mantenint la mateixa estructura de 88 blocs: 40 Mamba, 40 MoE i 8 d'atenció. La clau rau en la poda selectiva: es va reduir la mida de l'estat SSM de Mamba de 128 a 96 canals, es va disminuir la mida intermèdia dels experts encaminats de manera heterogènia (de 2688 a una mitjana del 59,9%) i es va ajustar el nombre d'experts activats per token (de 22 a una mitjana de 10). Tot sense tocar les capes d'atenció, que ja eren eficients quant a memòria cau KV.
El resultat és impressionant: en un node 8xB200 amb pesos NVFP4, el rendiment total de sortida (throughput) augmenta entre 1,60x i 2,14x segons l'escenari, especialment en tasques amb predomini de descodificació (com generació de text llarg). En una sola GPU H100, el model permet gestionar fins a 8 sol·licituds concurrents d'1 milió de tokens, davant d'1 sol·licitud del model original, gràcies a la reducció de pes de 70 GB a 44,5 GB. Això és possible gràcies a una tècnica de cerca d'arquitectura neuronal descomposta anomenada Puzzle, que optimitza l'assignació de capacitat bloc a bloc mitjançant un programa mixt enter.
Per a les empreses que busquen integrar intel·ligència artificial en els seus processos, aquest tipus de compressió representa un canvi de paradigma. Ja no cal disposar d'enormes clústers per executar models d'última generació. Per exemple, una empresa de serveis de documentació que utilitzi RAG (Retrieval-Augmented Generation) amb context d'1M de tokens pot passar d'atendre 1 petició concurrent a 8 en la mateixa GPU, multiplicant per 4 el rendiment de descodificació agregat. De la mateixa manera, els assistents de codificació interactius poden servir el doble de sol·licituds completades per minut.
No obstant això, la compressió no és gratuïta. Les avaluacions mostren una pèrdua en benchmarks com Arena-Hard-V2 (-4,2 punts) i SWE-Bench (-2,6 punts), tot i que les tasques de context llarg com RULER amb prou feines es veuen afectades. NVIDIA va aplicar un procés de recuperació mitjançant destil·lació de coneixement (knowledge distillation) i aprenentatge per reforç (RL) per mitigar aquestes caigudes, aconseguint que el model recuperi més del 97% del rendiment original en la majoria de categories. La destil·lació es va realitzar amb dades de preentrenament i SFT, utilitzant seqüències de fins a 512K de longitud, i el RL es va centrar en enginyeria de programari per millorar el rendiment en tasques agèntiques.
Des d'una perspectiva empresarial, l'adopció de models comprimits com Puzzle-75B-A9B permet a les organitzacions democratitzar l'accés a la IA generativa. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que la clau no està només en el model, sinó en com s'integra en la infraestructura existent. Oferim serveis de aplicacions a mida que permeten als nostres clients desplegar aquests models de manera eficient, ja sigui en cloud AWS/Azure o en entorns on-premise. La compressió redueix els costos d'inferència i permet escalar sense necessitat d'invertir en maquinari addicional.
A més, la ciberseguretat és un aspecte crític quan es manegen models amb accés a dades sensibles. A Q2BSTUDIO oferim solucions de ciberseguretat que garanteixen la protecció de les dades durant l'entrenament i la inferència, implementant controls d'accés, xifratge i auditoria. També ajudem les empreses a crear panells de Business Intelligence amb Power BI per monitoritzar el rendiment dels models, analitzar costos i optimitzar els fluxos de treball d'IA.
La integració de models com Puzzle-75B-A9B amb serveis cloud d'AWS o Azure permet a les empreses aprofitar l'escalabilitat elàstica sense preocupar-se per la gestió de la infraestructura. A Q2BSTUDIO oferim consultoria i desenvolupament per a cloud AWS/Azure, dissenyant arquitectures serverless o basades en contenidors per executar inferències de manera eficient. L'automatització de processos mitjançant agents d'IA es beneficia directament de la reducció de latència que proporciona aquest model comprimit.
En definitiva, Nemotron Labs 3 Puzzle 75B A9B representa una fita en la compressió de models de llenguatge. La seva capacitat per executar tasques de context ultra llarg en maquinari assequible, juntament amb una pèrdua de qualitat controlada, el converteix en una opció atractiva per a empreses que busquen implementar IA generativa a escala sense disparar els costos. A Q2BSTUDIO, estem preparats per ajudar les empreses a fer el salt cap a la propera generació d'aplicacions intel·ligents, combinant models d'avantguarda amb solucions de programari a mida, cloud, ciberseguretat i BI. El futur de la IA empresarial ja és aquí, i està comprimit.





