Gemini 3.6 Flash de Google redueix costos de tokens per a agents empresarials

Gemini 3.6 Flash redueix fins al 65% els tokens en agents empresarials. Accelera fluxos i estalvia costos. Novetats en ciberseguretat.

domingo, 26 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Menos tokens, más velocidad: la apuesta de Google para agentes IA

En l'ecosistema actual d'intel·ligència artificial empresarial, l'eficiència en l'ús de tokens s'ha convertit en un factor crític per a la viabilitat econòmica dels agents autònoms. Google ha llançat Gemini 3.6 Flash i 3.5 Flash-Lite, dos models dissenyats específicament per reduir la latència i el cost per token en fluxos de treball que requereixen raonament continu. Mentre que els models de propòsit general solen optimitzar-se per a respostes ràpides en interfícies conversacionals, els agents empresarials que operen en segon pla necessiten un equilibri diferent: prioritzar el rendiment en tasques repetitives i minimitzar la despesa en cada pas de raonament. Aquí és on Gemini 3.6 Flash marca una diferència substancial, oferint fins a un 17 % menys de tokens de sortida que el seu predecessor segons l'Artificial Analysis Index, i en benchmarks sintètics com Datacurve DeepSWE s'han registrat reduccions de fins al 65 %.

Per a una empresa que desenvolupa aplicacions a mida amb components d'IA, cada token que un model genera representa un cost directe i un increment en el temps de resposta. Amb preus d'1,50 $/1M de tokens d'entrada i 7,50 $/1M de tokens de sortida, Gemini 3.6 Flash està pensat per a bucles de raonament que s'executen de forma ininterrompuda, no sota demanda. Això el converteix en una opció atractiva per a sistemes d'automatització de processos, anàlisi de documents legals o financers, i generació d'informes multimodals. Google també ha integrat una eina d'ús d'ordinador nativa a l'API de Gemini, eliminant la necessitat de programari intermediari personalitzat que els enginyers solien construir perquè els models poguessin interactuar amb sistemes operatius. A la prova OSWorld-Verified, el model va assolir un 83,0 % d'encert davant del 78,4 % anterior.

El rendiment en tasques de codificació també ha millorat de forma significativa. A DeepSWE, Gemini 3.6 Flash aconsegueix un 49 % d'èxit davant del 37 % de la versió 3.5 Flash. A MLE Bench, el resultat puja del 49,7 % al 63,9 %. I a GDPval-AA v2, una prova que mesura treball intel·lectual real més enllà de trencaclosques de programació, la puntuació passa de 1349 a 1421. Aquestes xifres demostren que el model no només és més barat per token, sinó que també és més competent en tasques complexes. Empreses com Figma, Hebbia i Harvey ja l'han integrat en les seves infraestructures de prototipat, anàlisi de documents legals i recerca financera, respectivament.

Paral·lelament, Google ha llançat Gemini 3.5 Flash-Lite, una variant encara més econòmica i ràpida orientada a tasques d'alt volum. Amb un preu de 0,30 $/1M de tokens d'entrada i 2,50 $/1M de tokens de sortida, arriba a 350 tokens per segon segons l'Artificial Analysis Index, sent el model més ràpid de la sèrie 3.5. Està dissenyat per a subagents que realitzen cerques o processament de documents sense necessitat de raonament profund, permetent als equips d'enginyeria assignar nivells de pensament mínims a tasques senzilles i reservar els nivells superiors per a fluxos de treball multipas. A la prova GDM-MRCR v2 de context llarg, Flash-Lite obté un 72,2 % d'èxit davant del 60,1 % del seu predecessor, i la seva puntuació a GDPval-AA v2 gairebé es duplica, passant de 642 a 1140.

Una altra novetat rellevant és Gemini 3.5 Flash Cyber, un model restringit per a la validació i remediació de vulnerabilitats de codi. En un entorn on les eines d'escaneig automatitzat superen en velocitat la capacitat de pegat dels equips de seguretat, aquest model ofereix una solució específica. Distribuït només a governs i socis verificats mitjançant un programa pilot, Gemini 3.5 Flash Cyber s'executa en paral·lel dins de l'agent CodeMender de Google, cotejant troballes entre múltiples instàncies abans de generar un informe de remediació que un revisor humà aprova. Això encaixa perfectament amb les necessitats de ciberseguretat empresarial, on la velocitat i precisió en la correcció de fallades és crítica.

Per a les empreses que busquen integrar aquestes capacitats en els seus sistemes, la combinació de models de baix cost i alt rendiment obre noves possibilitats en l'automatització de processos. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, treballem amb companyies que necessiten construir agents d'IA personalitzats que interactuïn amb la seva infraestructura cloud, ja sigui a AWS o Azure. La clau està en dissenyar una arquitectura que distribueixi les tasques entre models més lleugers i ràpids (com Flash-Lite) i models més potents (com 3.6 Flash) en funció de la complexitat, optimitzant així el cost total per operació. A més, la integració amb eines de Business Intelligence com Power BI permet que aquests agents no només executin accions, sinó que també alimentin dashboards amb dades processades en temps real, facilitant la presa de decisions.

La reducció de costos de tokens no és només una millora incremental: transforma l'economia dels agents autònoms. Abans, executar un bucle de raonament de diversos passos podia resultar prohibitiu per a tasques que es repeteixen milers de vegades per hora. Amb Gemini 3.6 Flash i la seva variant Lite, el cost per operació es redueix dràsticament, fent viable l'automatització de processos que abans requerien intervenció humana constant. Això és especialment rellevant en sectors com la banca, la logística o la sanitat, on els marges són estrets i l'eficiència és clau.

Per treure el màxim profit d'aquests models, és recomanable combinar-los amb pràctiques d'automatització de processos de programari i una arquitectura cloud escalable. A Q2BSTUDIO ajudem les empreses a dissenyar solucions híbrides on els agents d'IA s'executen sobre infraestructura AWS o Azure, utilitzant serveis com Lambda, Kubernetes o funcions serverless per gestionar pics de demanda sense incrementar els costos fixos. La integració amb sistemes de BI com Power BI permet a més monitoritzar en temps real el rendiment dels agents i ajustar els models segons les necessitats del negoci.

Google ha anunciat que Gemini 3.5 Pro continua en proves amb socis, i que el preentrenament de Gemini 4 ja està en marxa. Això indica que la competència per reduir el cost per token s'intensificarà. Les empreses que adoptin ara aquestes tecnologies estaran millor posicionades per escalar les seves operacions d'intel·ligència artificial sense que els costos es disparin. En definitiva, Gemini 3.6 Flash no és només una actualització tècnica: és una eina estratègica per a qualsevol organització que vulgui integrar agents d'IA en els seus fluxos de producció de forma rendible i eficient.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.