En el món actual de la intel·ligència artificial, els sistemes de generació augmentada per recuperació (RAG) s'han convertit en una peça clau per construir aplicacions que combinen coneixement extern amb models de llenguatge. Però perquè un RAG funcioni correctament, cal disposar d'un motor de recuperació eficient. En aquest article comparteixo la meva experiència pràctica reproduint tres línies base fonamentals de recuperació —BM25, cerca densa i SPLADE— en un equip modest: un MacBook amb 16 GB de RAM. L'objectiu és oferir una guia útil per a desenvolupadors i empreses que busquen implementar solucions d'IA sense dependre d'infraestructures massives.
La reproducció d'aquests models no és trivial. BM25, un clàssic en recuperació d'informació, es basa en estadístiques de freqüència i longitud de documents. La seva implementació en Python amb biblioteques com rank_bm25 és directa, però en treballar amb col·leccions grans, l'optimització de memòria esdevé crítica. Al meu MacBook de 16 GB, vaig descobrir que el coll d'ampolla més gran no és el càlcul, sinó la manipulació d'índexs en memòria. Ajustant el chunking i usant arrays dispersos, vaig aconseguir un rendiment acceptable. No obstant, els \'crashes\' inicials em van portar a comprendre la importància d'alliberar memòria amb gc.collect() i reduir la mida dels lots.
La cerca densa, d'altra banda, introdueix embeddings generats per models com Sentence-BERT. Aquí el repte és doble: la generació de vectors i la indexació eficient. Amb 16 GB, no és possible carregar models grans sense quantització. Vaig optar per models lleugers com all-MiniLM-L6-v2 i vaig utilitzar FAISS per a la cerca de similitud cosinus. Les \'fixes\' clau van incloure la normalització de vectors i l'ús d'índexs plans en lloc de jeràrquics, que consumeixen més memòria. La verificació de puntuacions (score checks) em va permetre confirmar que els resultats eren coherents amb la literatura.
SPLADE, un model que combina sparse i dense, requereix encara més cura. La seva representació dispersa però basada en tokens exigeix un processament previ de vocabulari. Al meu MacBook, la implementació amb transformers i splade de huggingface va presentar problemes de memòria en expandir el vocabulari complet. La solució va ser limitar el nombre de tokens per document i usar torch.no_grad() per evitar l'acumulació de gradients. Després de diversos ajustos, vaig aconseguir reproduir els resultats de referència, validant que fins i tot equips modestos poden executar aquests models si s'optimitzen correctament.
Més enllà de l'aspecte tècnic, aquesta experiència té implicacions empresarials importants. A Q2BSTUDIO, entenem que l'adopció d'IA en entorns reals no sempre requereix clústers costosos. La capacitat de reproduir sistemes de recuperació en maquinari assequible democratitza l'accés a tecnologies com els agents IA, que depenen de cerques ràpides i precises per contextualitzar respostes. Per exemple, un assistent virtual per a l'atenció al client necessita combinar cerca híbrida (BM25 + dense) per oferir resultats rellevants en mil·lisegons.
A més, la integració d'aquests sistemes amb serveis al núbol com AWS o Azure pot escalar l'eficiència. A Q2BSTUDIO oferim solucions cloud que permeten desplegar motors de cerca amb alta disponibilitat. La ciberseguretat també hi té un paper: protegir els índexs i embeddings d'accessos no autoritzats és crític quan es manegen dades sensibles. D'altra banda, l'anàlisi dels resultats de cerca mitjançant eines de BI com Power BI permet a les empreses visualitzar patrons de consulta i optimitzar els seus models.
El desenvolupament d'aplicacions a mida per a RAG implica molt més que copiar codi de tutorials. Requereix entendre les compensacions entre precisió i latència, i saber quan utilitzar cada baseline. BM25 és excel·lent per a cerques per paraula clau, mentre que la cerca densa captura semàntica. SPLADE ofereix un punt intermedi. En projectes reals, combinem aquests enfocaments en pipelines híbrids, i el nostre equip de Q2BSTUDIO ajuda les empreses a seleccionar l'estratègia adequada segons les seves dades i pressupost.
Un aspecte que sovint es passa per alt és la validació de resultats. En la meva reproducció, els \'score checks\' (verificació de puntuacions) van ser essencials per detectar errors d'implementació. Per exemple, en comparar les puntuacions de BM25 amb valors esperats, vaig descobrir que el tokenitzador estava dividint malament certes paraules. Petits detalls com aquest poden fer que un sistema RAG produeixi respostes incorrectes. La disciplina de proves i validació és part del nostre enfocament a Q2BSTUDIO, on prioritzem la qualitat del software des del disseny.
La tendència cap a agents IA autònoms, que planifiquen i executen tasques, depèn fortament de la recuperació d'informació contextual. Un agent que necessita buscar documentació tècnica o historial d'interaccions ho ha de fer en temps real. Aquí, models com SPLADE ofereixen un equilibri entre eficiència i expressivitat. En la nostra experiència, la combinació d'aquests retrievers amb models de llenguatge grans (LLMs) potencia aplicacions d'intel·ligència empresarial, automatització de processos i anàlisi de dades.
Finalment, vull destacar que la reproducció d'aquests baselines no és un fi en si mateix, sinó un mitjà per comprendre les capacitats i limitacions de cada enfocament. Empreses com Q2BSTUDIO apliquen aquest coneixement en projectes de cloud AWS/Azure per a clients que necessiten sistemes de cerca escalables i segurs. A més, integrem eines de BI/Power BI per monitoritzar el rendiment dels motors de recuperació i ajustar estratègies d'indexació. La intersecció entre recuperació d'informació i altres àrees com la ciberseguretat és cada cop més rellevant, ja que els atacs d'enverinament de dades poden afectar la qualitat de les cerques.
En conclusió, si estàs considerant implementar un sistema RAG a la teva empresa, no necessites un superordinador. Amb un MacBook de 16 GB i les optimitzacions adequades, pots experimentar amb BM25, cerca densa i SPLADE. El coneixement adquirit et permetrà prendre decisions informades sobre l'arquitectura del teu producte. A Q2BSTUDIO, estem preparats per acompanyar-te en aquest viatge, oferint serveis de desenvolupament de programari a mida, intel·ligència artificial, ciberseguretat i cloud. El futur de la recuperació d'informació està a l'abast de tothom.





