AMD MI355X assoleix 2.626 tokens/s amb GLM5.2: el doble de barat que Blackwell

AMD MI355X supera Blackwell: 2.626 tok/s a meitat de preu. Descobreix com la inferència quantitzada canvia el cost de producció dels teus models d'IA.

sábado, 4 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Inferència IA competitiva a meitat de preu

El mercat de la inferència de models de llenguatge està experimentant una transformació silenciosa però profunda. Fins fa poc, la narrativa dominant situava NVIDIA com l'únic actor viable per servir models frontera en producció, amb les seves arquitectures Blackwell marcant l'estàndard de rendiment. No obstant això, xifres recents publicades per proveïdors d'infraestructura com Wafer, en col·laboració amb passarel·les d'IA com Vercel AI Gateway i OpenRouter, han encès un debat necessari: l'AMD MI355X, equipat amb el model GLM-5.2 de Zhipu AI, aconsegueix una taxa agregada de 2.626 tokens per segon per node, reduint el cost a menys de la meitat en comparació amb Blackwell. No es tracta d'un benchmark de laboratori: són càrregues de treball reals, amb perfils de producció que inclouen 20.000 tokens d'entrada, 1.000 de sortida i un 60% d'encert en memòria cau. La pregunta que sorgeix per a qualsevol professional que desplegui intel·ligència artificial en entorns productius és si aquest avantatge de cost justifica la inversió en optimització de programari, atès que l'ecosistema ROCm encara requereix un ajust fi.

Per entendre l'abast d'aquest canvi, convé analitzar la relació prestació-preu. Segons les dades disponibles, el MI355X ofereix al voltant del 80% del rendiment punta d'un B200, però a un cost per GPU que multiplica per 2,75 l'eficiència econòmica. Traduït a dòlars per token servit, el MI355X resulta més de 2,2 vegades superior en rendiment per cost. Això té implicacions directes en la viabilitat de projectes que depenen d'un volum elevat de peticions, com els agents d'IA que executen múltiples trucades per sessió d'usuari o els sistemes de processament per lots per a petites i mitjanes empreses. Quan el cost d'inferència es redueix a la meitat, fluxos de treball que abans eren inviables —com cadenes multiagent, revisions de codi iteratives o generació estructurada de documents— es tornen econòmicament sostenibles. A Q2BSTUDIO, entenem que aquests avenços s'han de traduir en solucions d'intel·ligència artificial per a empreses que realment transformin les seves operacions, ja sigui a través d'aplicacions a mida que integrin models optimitzats o mitjançant serveis cloud aws i azure que escalin la infraestructura necessària.

La discussió a la comunitat tècnica ha posat sobre la taula una objecció raonable: els resultats s'obtenen amb quantització mxFP4, una precisió reduïda que pot afectar la qualitat del model en tasques creatives o de raonament complex. És cert que cap quantització és perfectament lossless, però per a un ampli espectre de casos d'ús empresarial —generació d'informes, extracció de dades, assistència en codi, atenció al client— la diferència entre una FP4 ben ajustada i una FP16 de referència és menyspreable. De fet, la majoria dels proveïdors d'inferència ja utilitzen quantització en producció; el debat real és sobre el nivell d'optimització i si el llindar de qualitat es manté per a cada aplicació concreta. Aquí entra el valor de comptar amb un equip que pugui avaluar i adaptar aquests models al context específic de cada negoci, desenvolupant programari a mida que garanteixi tant el rendiment com la fidelitat dels resultats.

Un altre punt que mereix atenció és la bretxa de programari. Mentre que CUDA gaudeix de quinze anys de maduresa, ROCm encara exigeix un treball considerable per part d'equips especialitzats per assolir el màxim rendiment. No obstant això, el fet que un proveïdor de producció hagi aconseguit aquestes xifres demostra que la bretxa s'està tancant. Cada cop més startups i consultores tecnològiques inverteixen en capes d'optimització sobre ROCm, cosa que accelera la seva adopció. Per a una empresa que vulgui mantenir el seu avantatge competitiu, avaluar periòdicament el maquinari AMD en els seus pipelines d'inferència ja no és una opció: és una necessitat. La reducció de costos permet redirigir pressupost cap a altres àrees crítiques, com la ciberseguretat o la millora dels sistemes d'intel·ligència de negoci. De fet, eines com Power BI es poden beneficiar d'un processament de llenguatge natural més econòmic, integrant models d'IA que analitzin grans volums de dades sense disparar els costos d'infraestructura.

Més enllà de les xifres concretes, el moviment d'AMD en el segment d'inferència té una conseqüència estratègica: obliga NVIDIA a reaccionar, ja sigui reduint preus (poc probable donada la demanda insatisfeta) o accelerant l'arribada d'arquitectures específiques per a inferència, com la propera Rubin. Mentrestant, l'ecosistema d'agents d'IA i automatització de processos es beneficia directament d'aquesta competència. Els equips que abans evitaven desplegar models frontera pel cost ara poden plantejar-se arquitectures amb múltiples agents col·laboratius, on cada trucada costa la meitat. Per a Q2BSTUDIO, aquesta realitat reforça la nostra aposta per oferir serveis d'intel·ligència de negoci i solucions cloud que integrin el millor d'ambdós mons: l'eficiència del maquinari AMD i la maduresa de les plataformes Azure o AWS. La clau no està en quin fabricant de GPU és superior, sinó en quina combinació de maquinari, programari i optimització permet a cada organització assolir els seus objectius sense comprometre la qualitat ni el pressupost.

En definitiva, l'anunci del MI355X amb GLM-5.2 no és una simple nota de premsa: és un senyal que la guerra de la inferència ha canviat de bàndol. El cost per token ja no és una barrera insalvable per a la majoria dels casos d'ús empresarial. Les empreses que actuïn ara, avaluant aquestes alternatives i adaptant la seva arquitectura d'intel·ligència artificial, obtindran un avantatge significatiu en els propers mesos. Com sempre, la tecnologia avança més ràpid que els pressupostos; la diferència la marca la capacitat d'interpretar correctament les dades i prendre decisions informades.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.