Agents Genkit: Per què el tot és més que la suma de les parts

Descobreix com Genkit construeix agents d'IA modulars a partir de primitives simples: eines, middleware i interrupcions. Composició potent en poques

lunes, 6 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Primitives que es recombinan: la potència dels agents Genkit

En l'ecosistema del desenvolupament de programari basat en intel·ligència artificial, una de les preguntes més recurrents és com construir agents que realment funcionin en entorns productius. La temptació de recórrer a grans marcs monolítics que ofereixen una classe 'Agent' amb desenes d'opcions és forta, però cada vegada més equips tècnics busquen alternatives més lleugeres, modulars i predictibles. És aquí on l'enfocament basat en primitives petites i ben definides —com eines reutilitzables, interrupcions controlades, middleware apilable i sessions gestionades— demostra que la veritable potència no està en la quantitat de funcionalitats incloses, sinó en com es combinen. Aquesta filosofia de composició granular permet que comportaments avançats com l'aprovació humana en bucle, un assistent de codificació aïllat o la delegació entre múltiples agents sorgeixin de manera natural, sense necessitat de mòduls especialitzats que trenquin la coherència del sistema.

En la pràctica, un agent funcional pot definir-se amb només unes línies: una eina, un prompt de sistema i un emmagatzematge de sessió. La màgia comença quan decideixes on resideix l'estat. Si optes per un emmagatzematge gestionat al servidor, la sessió persisteix automàticament i l'agent manté el context entre torns; si prefereixes que el client porti l'estat (ideal per a desplegaments serverless o escalat horitzontal), simplement ometes aquest emmagatzematge i l'agent funciona igual. La mateixa interfície de xat, la mateixa capacitat de múltiples interaccions, però amb la llibertat d'escollir qui posseeix la memòria. Aquesta flexibilitat resulta essencial quan s'integren aplicacions a mida que han de funcionar tant al backend com al navegador, mantenint una experiència d'usuari coherent.

Un dels mecanismes més elegants dins d'aquesta arquitectura és la interrupció controlada. Una eina que no té implementació —el seu únic propòsit és pausar l'execució quan el model la 'invoca'— actua com un botó de pausa perfecte per a fluxos d'aprovació humana. L'agent s'atura, exposa les dades de la sol·licitud i espera una resposta per reprendre exactament des del punt on es va aturar. Això converteix cada crida a eina en un punt de control, sense necessitat de modes especials 'human-in-the-loop'. És el mateix mecanisme que permet a un assistent bancari sol·licitar confirmació abans d'una transferència, i també el que utilitza un agent de codificació per demanar permís abans d'executar una ordre potencialment perillosa. La reutilització d'aquest patró simplifica enormement el desenvolupament d'ia per a empreses, on els processos de supervisió són crítics.

El següent nivell de composició l'aporta el middleware. Una simple llista de peces —accés a sistemes de fitxers, biblioteques d'habilitats, comportes d'aprovació, reintents i delegació a subagents— s'apila en el mateix ordre que defineixes, i cada peça es reforça amb les altres. La comporta d'aprovació, per exemple, no inventa un nou sistema d'interrupció: utilitza exactament el mateix primitiu d'interrupció que podries implementar a mà. Els subagents són simplement eines que executen altres agents, i els artefactes flueixen entre ells gràcies a l'emmagatzematge compartit. Aquesta capacitat d'apilar capacitats sense codi addicional és especialment valuosa quan una empresa necessita desplegar agents IA que gestionin des de consultes d'atenció al client fins a anàlisi de logs de seguretat, tot des d'una base comuna.

Des d'una perspectiva empresarial, la potència d'aquest model rau en que el mateix agent s'executa idènticament al servidor i al navegador. El backend exposa l'agent com un endpoint HTTP estàndard, i el client es connecta mitjançant un client remot que ofereix la mateixa interfície de xat, el mateix streaming de respostes i la mateixa gestió d'interrupcions. Això elimina la fricció entre desenvolupament frontend i backend, i permet que els equips treballin sobre un mateix nucli de lògica d'IA. Empreses com Q2BSTUDIO, especialitzades en programari a mida, aprofiten aquesta homogeneïtat per construir solucions que abasten des de serveis cloud aws i azure fins a serveis intel·ligència de negoci amb power bi, integrant agents d'IA com a capa conversacional que interactua amb dades en temps real.

Finalment, no podem ignorar l'aspecte de ciberseguretat. En poder interrompre eines d'accés a shell o al sistema de fitxers, i en delegar l'aprovació d'operacions sensibles a una capa de middleware, es genera un entorn controlat on cada acció pot ser auditada i autoritzada. Aquesta arquitectura encaixa perfectament en entorns que requereixen compliment normatiu o que gestionen dades crítiques. A Q2BSTUDIO integrem aquests principis a les nostres solucions, oferint a les organitzacions la capacitat d'adoptar intel·ligència artificial sense renunciar al control, l'escalabilitat ni la transparència. Al final, el que realment supera la suma de les parts no és la tecnologia en si, sinó la capacitat de pensar en termes de blocs petits que encaixen de manera natural per resoldre problemes complexos.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.