El món de la intel·ligència artificial avança a un ritme vertiginós, i un dels desafiaments més persistents ha estat com portar models de gran mida a dispositius amb recursos limitats, com telèfons intel·ligents i portàtils. PrismML acaba de presentar Bonsai 27B, una versió comprimida del model Qwen3.6-27B que utilitza representacions de pesos d'1 bit i ternaris. Aquest desenvolupament no només redueix dràsticament la mida del model, sinó que aconsegueix mantenir un rendiment sorprenentment proper a l'original en FP16. En aquest article explorarem en profunditat què significa això per a la indústria, com s'aconsegueix aquesta compressió i per què representa una fita en la democratització de la intel·ligència artificial.
Bonsai 27B no és un model preentrenat des de zero, sinó una adaptació de Qwen3.6-27B que reemplaça els pesos de punt flotant de 16 bits per valors ternaris (−1, 0, +1) o binaris (−1, +1). Cada grup de 128 pesos comparteix una escala en FP16, la qual cosa permet una mitjana d'1,71 bits per pes en la versió ternària i 1,125 bits a la binària. Això es tradueix en mides ideals de 5,9 GB i 3,9 GB respectivament, enfront dels 54 GB del model original. La reducció és d'aproximadament 9,4 vegades i 14,2 vegades en comparació amb FP16. El més notable és que el rendiment no es desploma: en una avaluació de 15 benchmarks en mode raonament, la versió ternària reté el 94,6 % de la precisió original, mentre que la binària assoleix el 89,5 %.
Aquest assoliment és possible gràcies a l'arquitectura de Qwen3.6-27B, que utilitza una atenció lineal en aproximadament el 75 % de les seves capes. Això redueix dràsticament el creixement del caixet KV (Key-Value), permetent contextos de fins a 262 000 tokens sense explosió de memòria. La compressió de pesos, combinada amb un caixet KV de 4 bits, fa que Bonsai 27B càpiga en dispositius amb 12 GB de RAM, com un iPhone, respectant els límits que Apple imposa a les aplicacions (aproximadament la meitat de la memòria física).
El rendiment en tasques específiques és revelador. En matemàtiques, el model ternari assoleix un 93,4 % enfront del 95,33 % de l'original; en codificació, un 85,96 % enfront de 88,74 %; en coneixement i raonament, un 76,96 % enfront de 83,15 %. Les caigudes més pronunciades es donen en tasques d'agència i trucades a eines, així com en visió. No obstant això, la versió binària encara assoleix un 91,66 % en matemàtiques i un 81,88 % en codificació. Aquestes xifres demostren que, per a moltes aplicacions pràctiques, la pèrdua de precisió és perfectament assumible.
Els mètodes de quantificació tradicionals, com IQ2_XXS, solen col·lapsar en benchmarks llargs o complexos com AIME o LiveCodeBench, tot i mantenir bons resultats en proves curtes com MMLU-Redux. Bonsai evita aquest col·lapse en utilitzar una representació de pesos basada en codis amb escala compartida, en lloc de quantificar directament els valors. Aquesta tècnica, que recorda els enfocaments de BitNet però sense necessitat de preentrenar des de zero, permet que la compressió sigui efectiva fins i tot en models ja entrenats.
Des d'un punt de vista pràctic, Bonsai 27B obre possibilitats que abans semblaven ciència ficció. Executar un model de 27 mil milions de paràmetres en un telèfon o un portàtil amb consum energètic mínim ja és una realitat. La versió binària, per exemple, consumeix només 672 tokens per cada 1 % de bateria de l'iPhone, i la ternària ofereix més qualitat per a tasques que requereixen raonament més profund. Això permet aplicacions com assistents locals de codificació, anàlisi de documents extensos, o agents autònoms que operen sense connexió a internet.
Per a les empreses, aquest avenç té implicacions enormes. La possibilitat d'executar ia per a empreses directament en els dispositius dels usuaris redueix la dependència del núvol, millora la privacitat i elimina la latència. Combinat amb serveis cloud aws i azure per a tasques més pesades, es pot construir una arquitectura híbrida eficient. Per exemple, un assistent de vendes podria processar consultes localment en un portàtil fent servir Bonsai 27B, mentre que l'entrenament i les actualitzacions es gestionen al núvol.
La integració amb plataformes com llama.cpp i MLX facilita el desplegament en entorns variats. A més, PrismML ofereix un drafter especulatiu basat en Bonsai que accelera la generació fins a 1,37 vegades en maquinari NVIDIA, mantenint la distribució de sortida idèntica. Això és clau per a aplicacions en temps real com chatbots o assistents virtuals.
Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, veu en Bonsai 27B una oportunitat per crear aplicacions a mesura que integrin intel·ligència artificial d'alt rendiment sense sacrificar la portabilitat. El nostre equip pot ajudar-lo a dissenyar i implementar solucions que aprofitin models comprimits com Bonsai, ja sigui en l'àmbit de la ciberseguretat per a anàlisi d'amenaces en temps real, en serveis intel·ligència de negoci amb dashboards potenciats per IA, o en l'automatització de processos mitjançant agents IA. També oferim consultoria per integrar power bi amb models de llenguatge que generin informes automàtics basats en dades empresarials.
La capacitat d' executar models de 27B en maquinari modest obre la porta a aplicacions que abans requerien servidors dedicats. Per exemple, un sistema d'atenció al client podria utilitzar Bonsai 27B en mode ternari per comprendre consultes complexes i resoldre-les sense dependre d'una connexió a internet. O un editor de text podria incloure un assistent d'escriptura que funcioni completament offline, respectant la privacitat de l'usuari. En tots dos casos, la intel·ligència artificial es converteix en una eina ubiqua.
Des del punt de vista tècnic, la compressió ternària i binària de Bonsai no només redueix la mida, sinó que també accelera la inferència. Com que és la generació de text un procés limitat per l' ample de banda de memòria, tenir pesos més petits permet transferir més dades per segon, augmentant els tokens generats per unitat de temps. Les proves mostren que en un M5 Max amb la versió binària s'assoleixen 874 tokens per segon en prefill i 66,4 en generació, mentre que en un iPhone 17 Pro Max s'obtenen 111 tokens/s en prefill i 11 en generació. Aquests números són impressionants per a un model d' aquesta mida.
Per als desenvolupadors, l' API compatible amb OpenAI simplifica la integració. Bonsai 27B suporta trucades a funcions (tool calling) de forma nativa, la qual cosa permet construir agents que interactuen amb APIs externes, bases de dades o dispositius IoT. El mode de raonament està activat per defecte, però es pot ajustar mitjançant el paràmetre thinking_budget_tokens. Tot l' ecosistema es publica sota llicència Apache 2.0, la qual cosa fomenta l' adopció i personalització.
En resum, Bonsai 27B representa un salt qualitatiu en la compressió de models de llenguatge. No només demostra que és possible reduir la mida sense sacrificar massa precisió, sinó que ho fa sobre un model ja existent, sense necessitat de reentrenament costós. Per a empreses que busquen implementar ia per a empreses de forma eficient, aquesta tecnologia és un aliat estratègic. En Q2BSTUDIO, estem preparats per ajudar-lo a explorar aquestes possibilitats i crear programari a mesura que integri models d'avantguarda en els seus processos de negoci. Contacti'ns per descobrir com podem transformar les seves idees en solucions reals.




