Integració de LLMs de Pes Obert en Producció: Guia Pràctica

Aprèn a integrar models de pes obert en producció amb Node.js. Guia pràctica amb patrons de codi per streaming, pressupost de tokens i registre de models.

miércoles, 29 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Patrones de Código Prácticos para Integrar LLMs

La integració de models de llenguatge de gran escala (LLMs) de pes obert en entorns productius ha passat de ser un experiment de laboratori a una estratègia sòlida per a empreses que busquen flexibilitat i control sobre les seves solucions d'IA. A Q2BSTUDIO, com a empresa especialitzada en desenvolupament d'aplicacions a mida, hem observat com aquesta tendència transforma la manera en què es dissenyen sistemes conversacionals i agents intel·ligents. Aquest article ofereix una guia pràctica per desplegar aquests models en producció, centrant-se en patrons d'implementació reals i evitant dependre d'una única plataforma propietària.

Per què ara? En els últims dos anys, la bretxa entre les API tancades (com les d'OpenAI) i els models de pes obert s'ha reduït dràsticament. Avui és possible servir un model com Llama o Mistral darrere d'un endpoint HTTPS que exposa una interfície compatible amb chat completions, similar a la que ja fas servir. Això permet que equips de desenvolupament integrin IA sense canviar el seu codi frontal, mentre obtenen control total sobre el model, els costos i la latència. La flexibilitat arquitectònica és enorme: amb un mateix format de sol·licitud pots enrutar tasques a diferents models segons la seva especialitat, cosa que resulta crítica en projectes d'intel·ligència artificial a mida.

Flexibilitat en l'arquitectura En lloc de dependre d'un únic proveïdor, pots dissenyar un sistema que utilitzi diferents models de pes obert per a diferents tasques: un per a atenció al client, un altre per a anàlisi de dades, i un altre per a generació d'informes. Des de la perspectiva del front-end, l'endpoint segueix sent el mateix, cosa que manté el codi estable i facilita les proves. A Q2BSTUDIO apliquem aquest enfocament en els nostres desenvolupaments de Business Intelligence i Power BI, on un model obert pot processar consultes en llenguatge natural i generar visualitzacions de forma dinàmica.

CI/CD i pinning de models Un altre avantatge clau és la capacitat de fixar una revisió específica d'un model (model pinning) i executar proves de regressió amb els mateixos mocks HTTP que ja utilitzes. En ser un model obert, pots inspeccionar el tokenitzador, la finestra de context i els tokens especials, cosa que permet optimitzacions precises per reduir la latència i el cost. Això encaixa perfectament en pipelines d'integració contínua (CI/CD) de projectes que requereixen ciberseguretat i compliment normatiu, ja que pots auditar cada versió del model abans de desplegar-lo.

Autoallotjament i entorns aïllats Si la teva organització necessita mantenir les dades dins d'un entorn controlat (per raons de compliment o latència), els models de pes obert es poden exportar i executar a la teva pròpia infraestructura cloud, ja sigui a AWS, Azure o entorns híbrids. A Q2BSTUDIO oferim serveis cloud a AWS i Azure que faciliten el desplegament d'aquests models, mantenint la mateixa interfície de chat completions. D'aquesta manera, no has de reescriure la capa d'integració si canvies de proveïdor o decideixes migrar a autoallotjament.

Primera crida: el patró mínim Comencem amb un exemple senzill utilitzant Node.js 18+ i l'API fetch nativa. Assumim que tens accés a un endpoint compatible amb OpenAI (per exemple, NovaStack) i una clau API. La URL base típica és https://www.novapai.ai/v1/chat/completions, i l'autenticació es fa mitjançant un token Bearer a la capçalera Authorization. El cos de la sol·licitud segueix l'estructura {model, messages}. A continuació, un fragment de codi que realitza una consulta única:

const BASE_URL = 'https://www.novapai.ai';const API_KEY = process.env.NOVASTACK_API_KEY;async function chatOnce(content) { const response = await fetch(`${BASE_URL}/v1/chat/completions`, { method: 'POST', headers: { 'Content-Type': 'application/json', Authorization: `Bearer ${API_KEY}` }, body: JSON.stringify({ model: 'open-model', messages: [{ role: 'user', content }] }) }); if (!response.ok) { const err = await response.text(); throw new Error(err); } return await response.json();}

Streaming de respostes Per a interfícies d'usuari interactives, el streaming token a token és essencial. Activant l'opció stream: true a la sol·licitud, l'endpoint retorna un flux Server-Sent Events. El següent patró llegeix el cos de la resposta com un stream i processa cada línia de dades, extraient el contingut delta i executant un callback. Aquest mètode és ideal per a chatbots i assistents virtuals que requereixen respostes en temps real.

Historial de conversa i pressupost de tokens En aplicacions multi-torn, cal emmagatzemar l'historial de missatges (usuari i assistent) i gestionar el límit de tokens del context. Com que el model és obert, podem implementar una funció d'estimació de tokens senzilla (per exemple, comptant caràcters dividits per 4) i un mecanisme de poda que elimina els missatges més antics quan se supera un llindar. Això permet mantenir sessions llargues sense excedir la finestra de context. En projectes d'automatització de processos, aquesta tècnica és clau per construir agents que recordin interaccions prèvies.

Registre de models i gestió de quotes Amb la proliferació de models oberts, un patró útil és envoltar l'endpoint en un registre (registry) que associï identificadors de model amb metadades com finestra de context, nivell de servei o límit de quota. D'aquesta manera, l'equip pot canviar de model sense modificar el codi de crida. A Q2BSTUDIO utilitzem aquest patró en plataformes d'IA per a clients que necessiten equilibrar càrregues entre models gratuïts i premium, o entre versions especialitzades per a diferents dominis.

Script de línia d'ordres Per a prototipat ràpid o eines internes, un wrapper shell amb curl permet provar l'endpoint des de la terminal. La següent ordre envia un prompt i extreu la resposta utilitzant Node.js per analitzar el JSON: curl -s -X POST https://www.novapai.ai/v1/chat/completions -H 'Content-Type: application/json' -H 'Authorization: Bearer $NOVASTACK_API_KEY' -d '{'model':'open-model','messages':[{'role':'user','content':'Hola'}]}' | node -e 'let d='';process.stdin.on('data',c=>d+=c).on('end',()=>console.log(JSON.parse(d).choices[0].message.content))'

Conclusió i propers passos Integrar LLMs de pes obert en producció ja no és un somni futur: els patrons de codi presentats (crida simple, streaming, gestió de context i registre de models) permeten a qualsevol equip començar avui mateix. A Q2BSTUDIO, com a empresa de desenvolupament de programari a mida, recomanem començar amb la crida única, afegir streaming per a interfícies, després implementar gestió d'historial i finalment envoltar-ho tot en un registre per facilitar el manteniment. A més, combinant aquests models amb serveis cloud (AWS/Azure) i eines de BI com Power BI, s'obren possibilitats d'automatització intel·ligent que abans requerien equips sencers d'enginyers. Prova els fragments en un workspace gratuït de NovaStack i experimenta amb tècniques d'optimització conscients del tokenitzador. El futur de la IA aplicada és obert, flexible i està llest perquè l'integrin al vostre stack.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.