La intel·ligència artificial generativa i els sistemes de recuperació augmentada (RAG) estan redefinint la manera com les empreses processen i consulten grans volums de dades. En aquest context, NVIDIA ha presentat la seva nova família de models d'embeddings, Nemotron 3 Embed, una col·lecció oberta que promet transformar la capa de representació semàntica en aplicacions de producció. Amb tres checkpoints disponibles —8B, 1B en BF16 i 1B en NVFP4—, aquesta proposta es posiciona com la número u al benchmark RTEB (Retrieval Embedding Benchmark) amb una puntuació mitjana de NDCG@10 de 78.46. Però més enllà de les xifres, el que és interessant és com aquesta tecnologia pot integrar-se en solucions empresarials reals, especialment quan es combina amb un enfocament de programari a mida que garanteixi escalabilitat, seguretat i rendiment.
Nemotron 3 Embed no és un model qualsevol; és el resultat d'un procés meticulós de compressió i destil·lació. El checkpoint de 8B, construït sobre Ministral-3-8B-Instruct-2512, utilitza atenció bidireccional i pooling mitjana sobre representacions a nivell de token, amb una longitud màxima de seqüència de 32.768 tokens. Això el converteix en una eina ideal per a tasques de recuperació de documents llargs, memòries d'agents i cerca multilingüe (avaluat en 34 idiomes). La versió d'1B, tant en BF16 com en NVFP4, s'obté mitjançant un pipeline de poda (NAS) i destil·lació des del model 8B, cosa que permet mantenir un 99% de precisió amb un consum de recursos significativament menor. En concret, el model NVFP4, optimitzat per a l'arquitectura Blackwell, ofereix fins al doble de rendiment en inferència respecte a BF16.
Per a les empreses que busquen implementar sistemes de RAG a escala, l'elecció del model d'embedding és crítica. Nemotron 3 Embed ofereix tres nivells de cost i rendiment: el 8B per a màxima precisió, l'1B BF16 per a un equilibri entre mida i exactitud, i l'1B NVFP4 per a desplegaments amb alta demanda de throughput. Aquesta flexibilitat permet dissenyar arquitectures de recuperació en diversos nivells, on consultes senzilles poden resoldre's amb models lleugers i les més complexes derivar-se al model més gran. En aquest sentit, des de Q2BSTUDIO, com a empresa especialitzada en Intel·ligència Artificial i desenvolupament de programari, veiem en aquesta col·lecció una oportunitat per optimitzar processos de cerca semàntica, classificació de documents i sistemes de recomanació en entorns cloud (AWS/Azure) i on-premise.
La implementació tècnica és senzilla gràcies a la compatibilitat amb Sentence Transformers i vLLM. Les consultes s'han de prefixar amb 'query:' i els documents amb 'passage:' (tot i que les funcions encode_query i encode_document ho fan automàticament). L'embedding final és L2 normalitzat, per tant el producte puntual equival a similitud cosinus. Un aspecte destacable és el suport per a mides d'embedding dinàmiques al model NVFP4: es pot retallar el vector de 2048 dimensions a 1024 o 512 sense perdre qualitat significativa, cosa que permet estalviar espai en índexs vectorials i accelerar cerques.
La ciberseguretat és un altre pilar que no podem ignorar en integrar models d'IA a l'empresa. Els embeddings poden exposar informació sensible si no es gestionen correctament. Per això, a Q2BSTUDIO recomanem combinar l'ús de models com Nemotron 3 Embed amb pràctiques de ciberseguretat robustes: control d'accés als vectors, xifrat en repòs i en trànsit, i auditoria de consultes. A més, la capacitat de processar fins a 32.768 tokens permet als agents d'IA mantenir converses llargues i contextuals, cosa que encaixa perfectament amb solucions d'automatització i business intelligence.
Des d'una perspectiva de negoci, l'adopció de models oberts com Nemotron 3 Embed redueix la dependència de proveïdors tancats i permet un major control sobre les dades. Les empreses poden desplegar aquests models a les seves pròpies infraestructures cloud (AWS, Azure) o en servidors locals, complint normatives de privacitat. A Q2BSTUDIO, ajudem els nostres clients a seleccionar el checkpoint adequat segons les seves necessitats de latència, volum de dades i pressupost, integrant a més eines de BI/Power BI per visualitzar mètriques de recuperació i rendiment. Els agents d'IA, alimentats per aquests embeddings, poden realitzar cerques en bases de coneixement corporatives, respondre preguntes complexes i automatitzar tasques d'atenció al client amb una precisió mai vista.
En conclusió, Nemotron 3 Embed representa un avenç significatiu en el camp dels models de representació per a recuperació. La seva combinació de precisió líder, eficiència computacional i flexibilitat de desplegament el converteixen en una opció estratègica per a qualsevol organització que vulgui potenciar els seus sistemes d'IA. A Q2BSTUDIO, estem preparats per assessorar i implementar aquestes solucions, adaptant-les a cada cas d'ús —ja sigui en aplicacions a mida, al núvol o amb un enfocament d'agents autònoms— i garantint sempre la seguretat i el rendiment que exigeix l'entorn empresarial actual.





