El llançament del model Kimi K3 de Moonshot AI ha sacsejat el panorama de la intel·ligència artificial. Amb 2,8 bilions de paràmetres, es converteix en el model open-weight més gran mai publicat, superant àmpliament el DeepSeek V4 Pro d'1,6 bilions. No obstant això, el que realment importa no és el nombre de paràmetres, sinó l'arquitectura que el sustenta. Moonshot ha optat per una estratègia centrada en la memòria, no en el còmput pur, cosa que marca un gir significatiu en com les empreses xineses estan sorteant les restriccions d'exportació de xips dels Estats Units.
Per entendre aquest moviment, cal diferenciar entre còmput i memòria. El còmput és la capacitat de realitzar càlculs per segon, mentre que la memòria és l'espai on s'emmagatzemen els paràmetres del model i les dades temporals. Les restriccions dels EUA limiten l'accés a GPUs avançades, però la memòria d'alta capacitat no està tan restringida. Moonshot ha explotat aquesta bretxa. La seva tècnica principal és el mixture-of-experts (MoE), que divideix el model en 896 experts especialitzats i només n'activa 16 per cada token, reduint dràsticament el càlcul per paraula. Tanmateix, tots els paràmetres han de romandre en memòria, a punt per ser invocats. Aquí és on l'aposta esdevé clau: han reduït la precisió de 16 bits a 4 bits mitjançant entrenament amb quantificació, aconseguint que el model ocupi només 1,4 TB en lloc dels 5,6 TB teòrics. Això permet que el model s'executi en clústeres d'aceleradors més modestos, sempre que tinguin prou memòria agregada.
A més, han introduït Kimi Delta Attention, una optimització que redueix la memòria necessària per gestionar contextos llargs de fins a un milió de tokens. En lloc d'emmagatzemar tot l'historial en memòria d'alt cost, utilitzen tècniques de memòria cau que acceleren la descodificació fins a 6,3 vegades en contextos de milió de tokens. Moonshot ha contribuït codi de memòria cau al projecte de códi obert vLLM, cosa que permet que el model sigui més eficient en entorns de servidor. Això és clau per a empreses que busquen aplicacions a mida per integrar aquest tipus d'IA sense incórrer en costos desorbitats.
Des d'una perspectiva empresarial, el Kimi K3 no és un model per a qualsevol organització. Moonshot recomana executar-lo en almenys 64 aceleradors connectats com un sol pool. Això implica una inversió en infraestructura de centre de dades, no en un simple servidor. Per a la majoria de les empreses de la regió Àsia-Pacífic, l'opció pràctica serà llogar capacitat dedicada al núvol, mantenint les dades dins del país sota contracte. Això satisfà els requisits de sobirania de dades que exigeixen els reguladors, però no ofereix la independència total dels proveïdors d'infraestructura que molts buscaven en optar per models open-weight. Empreses de desenvolupament com Q2BSTUDIO, especialitzades en serveis cloud AWS/Azure, poden ajudar a dissenyar arquitectures híbrides que equilibrin rendiment i compliment normatiu.
El cost també ha canviat. Kimi K3 s'ofereix a 3 dòlars per milió de tokens d'entrada (0,30 dòlars si el model ja ha vist aquest input) i 15 dòlars per milió de tokens de sortida. És molt més barat que el Fable 5 (50 dòlars per sortida), però supera competidors com GLM-5.2 (4,40 dòlars) i DeepSeek V4 (0,87 dòlars). A més, actualment només funciona amb màxim esforç de raonament, cosa que incrementa el cost per tasca. Les empreses han de pressupostar en funció del cost total de la tasca completada, no només del preu per token. Per optimitzar aquestes despeses, solucions d'automatització de processos poden reduir el nombre de tokens necessaris mitjançant workflows intel·ligents.
En l'àmbit de la ciberseguretat, el model planteja reptes addicionals. En ser open-weight, qualsevol organització pot descarregar-lo, modificar-lo i executar-lo localment. Això és un avantatge per a sectors com la banca i les assegurances, que necessiten que les dades mai abandonin els seus sistemes. Tanmateix, també obre la porta a usos maliciosos. Un model de 2,8 bilions de paràmetres és un objectiu atractiu per a atacs d'extracció de models o enverinament de dades. Les empreses que adoptin K3 han d'implementar mesures de ciberseguretat sòlides, incloent proves de penetració i monitoratge continu de la integritat del model. A més, la integració amb sistemes de Business Intelligence (BI) mitjançant eines com Power BI permet analitzar els resultats del model en dashboards en temps real, identificant anomalies en el comportament.
La intel·ligència artificial no es limita només a aquest model. Els agents d'IA, capaços d'executar tasques complexes de forma autònoma, són una tendència creixent. Kimi K3 podria servir com a base per a agents que requereixin comprensió de context llarg, com assistents d'investigació o anàlisi de documents legals. No obstant això, el seu alt consum de memòria el fa menys adequat per a desplegaments en dispositius edge. Aquí és on les solucions d'IA a mida, dissenyades per empreses com Q2BSTUDIO, poden adaptar el model a necessitats específiques, ja sigui mitjançant tècniques de destil·lació o quantificació addicional.
Les proves independents encara estan per arribar. El model no es va publicar oficialment fins al 27 de juliol, i les eines de códi obert s'estan adaptant per suportar les seves innovacions. Moonshot ha reconegut limitacions: inestabilitat en la generació quan l'historial de raonament no es gestiona correctament, decisions no sol·licitades quan el propòsit de l'usuari és ambigu, i una bretxa d'experiència d'usuari respecte a models com Claude Fable 5 i GPT 5.6 Sol. Tot i això, el moviment estratègic és clar: apostar per la memòria com a recurs menys restringit que el còmput. Això podria redefinir la cursa de la IA a la Xina i oferir noves oportunitats per a empreses que busquen programari a mida amb capacitats d'IA avançades.




