La intel·ligència artificial està experimentant una transformació silenciosa però profunda: el centre de gravetat s'està desplaçant des dels servidors al núvol cap als dispositius de l'usuari final. Google acaba de fer un pas decisiu en aquesta direcció amb el llançament de LiteRT.js, una biblioteca que permet executar models .tflite directament al navegador, aprofitant l'acceleració per WebGPU. Aquest moviment no només promet reduir costos i millorar la privacitat, sinó que reconfigura les possibilitats de les aplicacions web modernes. Per entendre el seu veritable abast, convé analitzar-lo des d' una perspectiva tècnica, empresarial i pràctica.
LiteRT.js no és un format nou ni un framework experimental. És, en essència, el mateix motor d'inferència nadiu que Google ha optimitzat durant anys per a Android, iOS i sistemes embeguts —anteriorment conegut com a TensorFlow Lite— compilat ara a WebAssembly i exposat a JavaScript. Això implica que les optimitzacions desenvolupades per al món mòbil, com quantització avançada, kernels multifil o suport per a acceleradors maquinari, arriben al navegador sense necessitat de reimplementar res. El resultat és una execució de models fins a tres vegades més ràpida que les solucions web prèvies, i entre cinc i seixanta vegades més veloç quan s'utilitza GPU o NPU davant la mateixa CPU del navegador.
L'arquitectura de LiteRT.js descansa sobre tres backend ben diferenciats: CPU, mitjançant XNNPACK amb suport multifil i SIMD relaxat; GPU, utilitzant ML Drift sobre WebGPU, i NPU, recolzant-se en l'experimental WebNN API de Chrome i Edge. Aquesta estratificació permet triar el nivell d' acceleració més adequat per a cada cas d' ús, tot i que amb una regla important: no es permet delegació parcial. Si un model no es pot executar completament en l'accelerador seleccionat, el sistema cau automàticament a WebAssembly. Aquesta decisió de disseny simplifica la gestió de memòria i evita colls d' ampolla entre contextos, tot i que limita la flexibilitat en models molt heterogenis.
Des del punt de vista de l' experiència de desenvolupament, LiteRT.js introdueix una novetat que molts equips hauran d' assimilar: la gestió manual de tensors. A diferència de TensorFlow.js, on el recol·lector d'escombraries de JavaScript s'encarrega d'alliberar memòria, aquí cada tensor s'ha d'eliminar explícitament amb .delet(). Google adverteix que ometre aquest pas provoca fuites de memòria en els dispositius, especialment a GPU. Aquest enfocament, més propi de C++ o Rust, ofereix un control més fi del rendiment, però exigeix disciplina al programador. Per a les empreses que desenvolupen aplicacions a mida amb components d' IA, aquesta característica pot suposar un desafiament addicional en la formació d' equips i en la qualitat del codi.
La compatibilitat amb models PyTorch es resol mitjançant LiteRT Torch, una eina de conversió directa que transforma models .pt a .tflite en un sol pas. No obstant això, els requisits són estrictes: el model ha de ser exportable amb torch.export.export, no pot contenir bifurcacions condicionals dependents de valors dinàmics i les dimensions d' entrada i sortida han de ser fixes, inclòs la mida del batch. Això descarta arquitectures que requereixin entrada variable, com certs transformers de processament de llenguatge natural. Per compensar, l'ecosistema inclou AI Edge Quantizer, que permet configurar esquemes de quantització per capa, i un repositori creixent de models preentrenats a Kaggle i Hugging Face.
Què suposa això per al teixit empresarial? En primer lloc, la possibilitat d'executar inferència d'IA completament al navegador obre la porta a una nova generació d'intel·ligència artificial sense dependència de servidors externs. La detecció d'objectes, la transcripció d'àudio, la millora d'imatges o la recerca semàntica poden realitzar-se amb latència ultrabaixa i sense enviar dades al núvol, cosa que reforça la ciberseguretat i la privacitat de l'usuari. Per a sectors com la salut, la banca o la defensa, on la confidencialitat de la informació és crítica, aquesta arquitectura representa un avantatge competitiu decisiu. Les empreses que integrin aquests fluxos en els seus portals web podran oferir funcionalitats d' IA per a empreses sense costos recurrents d' infraestructura.
A més, LiteRT.js no competeix frontalment amb TensorFlow.js, sinó que es posiciona com un complement especialitzat per a models .tflite. Google recomana mantenir TensorFlow.js per a tasques de preprocessat i postprocessat, i utilitzar LiteRT.js per a la inferència pesada. El paquet @litertjs/tfjs-interop permet passar tensors entre ambdues biblioteques sense còpies innecessàries, sempre que s'eviti l'ús de dataSync, que penalitza el rendiment a WebGPU. Aquesta coexistència obre un escenari interessant per als equips de desenvolupament que ja treballen amb frameworks de machine learning al frontend.
Des d'una òptica de negoci, LiteRT.js encaixa perfectament amb la tendència cap a la descentralització de la intel·ligència artificial. Els agents IA que funcionen completament en el dispositiu poden operar sense connexió, reaccionar en temps real i escalar sense necessitat d'aprovisionar servidors. Això és especialment rellevant per a aplicacions de realitat augmentada, assistents personals, eines d' accessibilitat i sistemes de monitoratge industrial. La capacitat d'executar models complexos al navegador també redueix la dependència de serveis cloud aws i azure, encara que aquests continuïn sent necessaris per a entrenament, emmagatzematge de dades agregades o models més grans. Precisament per això, moltes organitzacions opten per combinar la inferència local amb una arquitectura híbrida, on el núvol s'encarrega de la lògica pesada i el dispositiu ofereix una resposta immediata.
En aquest context, comptar amb un soci tecnològic que domini tant el desenvolupament de programari a mida com la integració d'intel·ligència artificial resulta fonamental. Q2BSTUDIO, com a empresa de desenvolupament de programari, ha acompanyat múltiples clients en l' adopció d' aquestes tecnologies, des de la creació de prototips amb TensorFlow.js fins al desplegament de models optimitzats en navegadors i dispositius mòbils. L'experiència acumulada en serveis intel·ligència de negoci i en plataformes cloud permet oferir solucions completes que van des de la captura de dades fins a la visualització en time real, passant per l'anàlisi predictiva i l'automatització de processos.
És probable que l'adopció de LiteRT.js s'acceleri quan WebGPU assoleixi una cobertura universal i WebNN maduri com a estàndard. Per ara, el backend més pràctic és WebGPU, que ja està disponible a Chrome, Edge i Firefox Nightly. Les proves de rendiment realitzades per Google sobre un MacBook Pro amb M4 mostren millores significatives, tot i que adverteixen que els resultats varien segons la GPU local, la gestió tèrmica i els controladors. Per a les empreses que busquen reduir costos d'infraestructura i millorar l'experiència d'usuari, el moment d'explorar aquesta tecnologia és ara.
En definitiva, LiteRT.js no és només una actualització tècnica: és un canvi de paradigma que acosta la intel·ligència artificial a l'usuari final amb tots els avantatges de la web. Per als equips de desenvolupament, implica aprendre noves pràctiques de gestió de memòria i comprendre les limitacions de delegació. Per als responsables de producte, significa poder oferir funcionalitats d'IA sense dependre de connexions a internet ni de servidors costosos. I per a les empreses que busquen diferenciar-se, representa una oportunitat de construir aplicacions web més ràpides, segures i escalables. La pregunta ja no és si la IA arribarà al navegador, sinó qui l'aprofitarà primer.


.jpg)
.jpg)
.jpg)
.jpg)