Nemotron Labs 3 Puzzle 75B A9B: LLM híbrido comprimido 2x rendimiento

Descubre el nuevo Nemotron-Labs-3-Puzzle-75B-A9B, un LLM híbrido comprimido que ofrece hasta 2.03x más rendimiento en servidores. Ideal para RAG y asistentes

miércoles, 29 de julio de 2026 • 4 min de lectura • Equipo Q2BSTUDIO

Optimización de MoE con iteraciones Puzzle para servidores

El panorama de la inteligencia artificial generativa avanza a un ritmo vertiginoso, pero la eficiencia en la implementación sigue siendo el gran desafío para las empresas que desean adoptar estos modelos a gran escala. Recientemente, el equipo de NVIDIA AI ha presentado Nemotron Labs 3 Puzzle 75B A9B, un modelo de lenguaje híbrido comprimido que logra duplicar el rendimiento del servidor respecto a su predecesor Nemotron-3-Super. Este avance no solo es técnicamente relevante, sino que abre nuevas posibilidades para el despliegue de agentes de IA, asistentes de programación y sistemas de recuperación de información con contexto ultra largo, todo ello en hardware asequible como una sola GPU H100 o un nodo B200.

Nemotron-3-Super es un modelo MoE (Mixture of Experts) híbrido que combina bloques Mamba, atención y MoE, con 120.700 millones de parámetros totales y 12.800 millones activos por token. Su versión comprimida, Puzzle-75B-A9B, reduce los parámetros totales a 75.300 millones y los activos a 9.300 millones, manteniendo la misma estructura de 88 bloques: 40 Mamba, 40 MoE y 8 de atención. La clave está en la poda selectiva: se redujo el tamaño del estado SSM de Mamba de 128 a 96 canales, se disminuyó el tamaño intermedio de los expertos encaminados de manera heterogénea (de 2688 a una media de 59,9%) y se ajustó el número de expertos activados por token (de 22 a una media de 10). Todo ello sin tocar las capas de atención, que ya eran eficientes en cuanto a caché KV.

El resultado es impresionante: en un nodo 8xB200 con pesos NVFP4, el rendimiento total de salida (throughput) aumenta entre 1,60x y 2,14x según el escenario, especialmente en tareas con predominio de decodificación (como generación de texto largo). En una sola GPU H100, el modelo permite manejar hasta 8 solicitudes concurrentes de 1 millón de tokens, frente a solo 1 del modelo original, gracias a la reducción de peso de 70 GB a 44,5 GB. Esto es posible gracias a una técnica de búsqueda de arquitectura neuronal descompuesta llamada Puzzle, que optimiza la asignación de capacidad bloque a bloque mediante un programa mixto-entero.

Para las empresas que buscan integrar inteligencia artificial en sus procesos, este tipo de compresión representa un cambio de paradigma. Ya no es necesario disponer de enormes clústeres para ejecutar modelos de última generación. Por ejemplo, una empresa de servicios de documentación que utilice RAG (Retrieval-Augmented Generation) con contexto de 1M de tokens puede pasar de atender 1 petición concurrente a 8 en la misma GPU, multiplicando por 4 el rendimiento de decodificación agregado. Del mismo modo, los asistentes de codificación interactivos pueden servir el doble de solicitudes completadas por minuto.

Sin embargo, la compresión no es gratuita. Las evaluaciones muestran una pérdida en benchmarks como Arena-Hard-V2 (-4,2 puntos) y SWE-Bench (-2,6 puntos), aunque tareas de contexto largo como RULER apenas se ven afectadas. NVIDIA aplicó un proceso de recuperación mediante destilación de conocimiento (knowledge distillation) y aprendizaje por refuerzo (RL) para mitigar estas caídas, logrando que el modelo recupere más del 97% del rendimiento del original en la mayoría de categorías. La destilación se realizó con datos de preentrenamiento y SFT, utilizando secuencias de hasta 512K de longitud, y el RL se centró en ingeniería de software para mejorar el rendimiento en tareas agénticas.

Desde una perspectiva empresarial, la adopción de modelos comprimidos como Puzzle-75B-A9B permite a las organizaciones democratizar el acceso a la IA generativa. En Q2BSTUDIO, como empresa de desarrollo de software y tecnología, entendemos que la clave no está solo en el modelo, sino en cómo se integra en la infraestructura existente. Ofrecemos servicios de aplicaciones a medida que permiten a nuestros clientes desplegar estos modelos de forma eficiente, ya sea en cloud AWS/Azure o en entornos on-premise. La compresión reduce los costes de inferencia y permite escalar sin necesidad de invertir en hardware adicional.

Además, la ciberseguridad es un aspecto crítico cuando se manejan modelos con acceso a datos sensibles. En Q2BSTUDIO ofrecemos soluciones de ciberseguridad que garantizan la protección de los datos durante el entrenamiento y la inferencia, implementando controles de acceso, cifrado y auditoría. También ayudamos a las empresas a crear paneles de Business Intelligence con Power BI para monitorizar el rendimiento de los modelos, analizar costes y optimizar los flujos de trabajo de IA.

La integración de modelos como Puzzle-75B-A9B con servicios cloud de AWS o Azure permite a las empresas aprovechar la escalabilidad elástica sin preocuparse por la gestión de la infraestructura. En Q2BSTUDIO ofrecemos consultoría y desarrollo para cloud AWS/Azure, diseñando arquitecturas serverless o basadas en contenedores para ejecutar inferencias de forma eficiente. Asimismo, la automatización de procesos mediante agentes de IA se beneficia directamente de la reducción de latency que proporciona este modelo comprimido.

En definitiva, Nemotron Labs 3 Puzzle 75B A9B representa un hito en la compresión de modelos de lenguaje. Su capacidad para ejecutar tareas de contexto ultra largo en hardware asequible, junto con una pérdida de calidad controlada, lo convierte en una opción atractiva para empresas que buscan implementar IA generativa a escala sin disparar los costes. En Q2BSTUDIO, estamos preparados para ayudar a nuestras empresas a dar el salto hacia la próxima generación de aplicaciones inteligentes, combinando modelos de vanguardia con soluciones de software a medida, cloud, ciberseguridad y BI. El futuro de la IA empresarial ya está aquí, y está comprimido.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.