Cómo reproduje BM25, Búsqueda Densa y SPLADE en una MacBook de 16GB

Aprende a reproducir tres baselines de recuperación en una MacBook de 16GB, con soluciones a errores y verificación de puntuaciones para sistemas RAG.

martes, 28 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Reproducción práctica de baselines de recuperación para RAG

En el mundo actual de la inteligencia artificial, los sistemas de generación aumentada por recuperación (RAG) se han convertido en una pieza clave para construir aplicaciones que combinan conocimiento externo con modelos de lenguaje. Pero para que un RAG funcione correctamente, es necesario contar con un motor de recuperación eficiente. En este artículo comparto mi experiencia práctica reproduciendo tres líneas base fundamentales de recuperación —BM25, búsqueda densa y SPLADE— en un equipo modesto: un MacBook con 16 GB de RAM. El objetivo es ofrecer una guía útil para desarrolladores y empresas que buscan implementar soluciones de IA sin depender de infraestructuras masivas.

La reproducción de estos modelos no es trivial. BM25, un clásico en recuperación de información, se basa en estadísticas de frecuencia y longitud de documentos. Su implementación en Python con bibliotecas como rank_bm25 es directa, pero al trabajar con colecciones grandes, la optimización de memoria se vuelve crítica. En mi MacBook de 16 GB, descubrí que el mayor cuello de botella no es el cómputo, sino la manipulación de índices en memoria. Al ajustar el chunking y usar arrays dispersos, logré un rendimiento aceptable. Sin embargo, los \'crashes\' iniciales me llevaron a comprender la importancia de liberar memoria con gc.collect() y reducir el tamaño de los lotes.

La búsqueda densa, por otro lado, introduce embeddings generados por modelos como Sentence-BERT. Aquí el reto es doble: la generación de vectores y la indexación eficiente. Con 16 GB, no es posible cargar modelos grandes sin cuantización. Opté por modelos ligeros como all-MiniLM-L6-v2 y utilicé FAISS para la búsqueda de similitud coseno. Los \'fixes\' clave incluyeron la normalización de vectores y el uso de índices planos en lugar de jerárquicos, que consumen más memoria. La verificación de puntuaciones (score checks) me permitió confirmar que los resultados eran coherentes con la literatura.

SPLADE, un modelo que combina sparse y dense, requiere aún más cuidado. Su representación dispersa pero basada en tokens exige un procesamiento previo de vocabulario. En mi MacBook, la implementación con transformers y splade de huggingface presentó problemas de memoria al expandir el vocabulario completo. La solución fue limitar el número de tokens por documento y usar torch.no_grad() para evitar el acumulamiento de gradientes. Después de varios ajustes, logré reproducir los resultados de referencia, validando que incluso equipos modestos pueden ejecutar estos modelos si se optimizan correctamente.

Más allá del aspecto técnico, esta experiencia tiene implicaciones empresariales importantes. En Q2BSTUDIO, entendemos que la adopción de IA en entornos reales no siempre requiere clusters costosos. La capacidad de reproducir sistemas de recuperación en hardware asequible democratiza el acceso a tecnologías como los agentes IA, que dependen de búsquedas rápidas y precisas para contextualizar respuestas. Por ejemplo, un asistente virtual para atención al cliente necesita combinar búsqueda híbrida (BM25 + dense) para ofrecer resultados relevantes en milisegundos.

Además, la integración de estos sistemas con servicios en la nube como AWS o Azure puede escalar la eficiencia. En Q2BSTUDIO ofrecemos soluciones cloud que permiten desplegar motores de búsqueda con alta disponibilidad. La ciberseguridad también juega un rol: proteger los índices y embeddings de accesos no autorizados es crítico cuando se manejan datos sensibles. Por otro lado, el análisis de los resultados de búsqueda mediante herramientas de BI como Power BI permite a las empresas visualizar patrones de consulta y optimizar sus modelos.

El desarrollo de aplicaciones a medida para RAG implica mucho más que copiar código de tutoriales. Requiere entender las compensaciones entre precisión y latencia, y saber cuándo usar cada baseline. BM25 es excelente para búsquedas por palabra clave, mientras que la búsqueda densa captura semántica. SPLADE ofrece un punto intermedio. En proyectos reales, combinamos estos enfoques en pipelines híbridos, y nuestro equipo de Q2BSTUDIO ayuda a las empresas a seleccionar la estrategia adecuada según sus datos y presupuesto.

Un aspecto que a menudo se pasa por alto es la validación de resultados. En mi reproducción, los \'score checks\' (verificación de puntuaciones) fueron esenciales para detectar errores de implementación. Por ejemplo, al comparar las puntuaciones de BM25 con valores esperados, descubrí que el tokenizador estaba dividiendo mal ciertas palabras. Pequeños detalles como este pueden hacer que un sistema RAG produzca respuestas incorrectas. La disciplina de pruebas y validación es parte de nuestro enfoque en Q2BSTUDIO, donde priorizamos la calidad del software desde el diseño.

La tendencia hacia agentes IA autónomos, que planifican y ejecutan tareas, depende fuertemente de la recuperación de información contextual. Un agente que necesita buscar documentación técnica o historial de interacciones debe hacerlo en tiempo real. Aquí, modelos como SPLADE ofrecen un balance entre eficiencia y expresividad. En nuestra experiencia, la combinación de estos retrievers con modelos de lenguaje grandes (LLMs) potencia aplicaciones de inteligencia empresarial, automatización de procesos y análisis de datos.

Finalmente, quiero destacar que la reproducción de estos baselines no es un fin en sí mismo, sino un medio para comprender las capacidades y limitaciones de cada enfoque. Empresas como Q2BSTUDIO aplican este conocimiento en proyectos de cloud AWS/Azure para clientes que necesitan sistemas de búsqueda escalables y seguros. Además, integramos herramientas de BI/Power BI para monitorear el rendimiento de los motores de recuperación y ajustar estrategias de indexación. La intersección entre recuperación de información y otras áreas como la ciberseguridad es cada vez más relevante, ya que los ataques de envenenamiento de datos pueden afectar la calidad de las búsquedas.

En conclusión, si estás considerando implementar un sistema RAG en tu empresa, no necesitas un superordenador. Con un MacBook de 16 GB y las optimizaciones adecuadas, puedes experimentar con BM25, búsqueda densa y SPLADE. El conocimiento adquirido te permitirá tomar decisiones informadas sobre la arquitectura de tu producto. En Q2BSTUDIO, estamos listos para acompañarte en ese viaje, ofreciendo servicios de desarrollo de software a medida, inteligencia artificial, ciberseguridad y cloud. El futuro de la recuperación de información está al alcance de todos.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.