La orquestració de múltiples models de llenguatge locals (LLMs) per impulsar agents d'IA especialitzats s'ha convertit en un repte tècnic de primer ordre. Ja no n'hi ha prou amb executar un únic model generalista: les arquitectures multiagent exigeixen que cada subagent utilitzi el model més adequat per a la seva tasca —raonament, generació de codi, resum ràpid—, optimitzant així el rendiment i l'ús de recursos hardware. En aquest article analitzem com implementar un pipeline concurrent amb Node.js i Ollama sobre una RTX 4090, compartim benchmarks reals i n'extraiem lliçons pràctiques per a equips que volen portar la intel·ligència artificial per a empreses a un nou nivell.
La idea central és senzilla: en lloc de carregar un únic LLM pesat per a tot, es desplega un conjunt de models més petits i especialitzats que treballen en paral·lel. Per exemple, un model de 7B per a codi, un de 8B per a raonament general i un altre de 2B per a resums. Això redueix la contenció de VRAM, accelera les respostes i permet escalar el sistema sense necessitat de hardware extrem. A Q2BSTUDIO dissenyem aplicacions a mida que integren aquest tipus d'orquestració, oferint als nostres clients solucions d'ia per a empreses robustes i eficients.
Per orquestrar múltiples LLMs locals, el backend (Node.js) actua com a cervell: rep peticions del frontend (Flutter), decideix quins models invocar segons el tipus d'agent i llança totes les consultes de forma concurrent mitjançant Promise.all. Aquest enfocament evita colls d'ampolla i redueix dràsticament el temps total de resposta. La nostra experiència en serveis cloud aws i azure ens permet traslladar aquesta arquitectura a entorns híbrids o completament cloud, garantint escalabilitat i alta disponibilitat.
Els benchmarks realitzats en una RTX 4090 amb 24 GB de VRAM revelen dades concretes: executant només Llama-3 8B s'assoleixen 108 tokens/segon; en afegir CodeLlama 7B i Gemma 2B de forma simultània, el rendiment de Llama-3 cau a 39 tok/s i el pic de VRAM arriba a 14,8 GB. La latència del primer token també augmenta sensiblement. Aquests números demostren que, tot i que és viable orquestrar tres models en una sola GPU, la gestió acurada de la memòria és crítica. Per això, als nostres projectes d'automatització de processos apliquem tècniques com quantització (q4_K_M), precàrrega de models i monitorització constant amb nvidia-smi.
Un altre error comú és assumir que Ollama gestiona automàticament la VRAM entre models. La realitat és que el paràmetre OLLAMA_MAX_VRAM permet fixar un límit global, però per a un control fi pot ser necessari executar diverses instàncies d'Ollama en ports diferents, cadascuna amb el seu model i configuració de GPU. Això és especialment rellevant quan s'integren serveis intel·ligència de negoci i ciberseguretat a l'ecosistema, ja que els agents IA han d'interactuar amb fonts de dades empresarials i complir estrictes requisits de seguretat.
En definitiva, orquestrar múltiples LLMs locals no és un luxe tècnic, sinó una necessitat per construir sistemes d'agents IA realment intel·ligents i eficients. A Q2BSTUDIO ajudem empreses a dissenyar i implementar aquestes arquitectures, combinant programari a mida, intel·ligència artificial i cloud per transformar processos de negoci. Si la teva organització busca fer el salt cap a un ecosistema multiagent optimitzat, el nostre equip pot guiar-te des del prototip fins a la producció.





