No hay API de OpenAI? No hay problema. Construye RAG localmente con Ollama y FastAPI

Construye una Red de Asistencia Global (RAG) en tu localidad utilizando Ollama y FastAPI. Aprende a crear una plataforma de ayuda local de forma eficiente y escalable.

martes, 25 de noviembre de 2025 • 4 min de lectura • Equipo Q2BSTUDIO

Construye RAG localmente con Ollama y FastAPI

He construido un sistema RAG totalmente local que permite a un modelo Llama 3 responder preguntas sobre mis propios archivos PDF y Markdown sin recurrir a APIs en la nube ni servidores externos, todo ejecutándose en mi equipo.

Componentes clave usados: Streamlit para la interfaz, FastAPI para la lógica del servidor, ChromaDB para el almacenamiento vectorial y Ollama para ejecutar Llama 3 de forma local. El sistema procesa documentos, los trocea y embebe, recupera los fragmentos relevantes para una consulta y se los proporciona al modelo para generar respuestas fundamentadas.

Flujo general de trabajo: ingestión y consulta. En la fase de ingestión se extrae texto desde PDF y Markdown, se limpia y se fragmenta en trozos de tamaño controlado. Encontré que trozos de aproximadamente 300 a 500 palabras con una solapación del 10 a 15% ofrecen un buen equilibrio entre contexto y detalle, y facilitan recuperar información coherente.

Almacenamiento semántico: cada fragmento se embebe con SentenceTransformers all-MiniLM-L6-v2 y se guarda en una colección local de ChromaDB. Cada documento queda representado como un vector en un espacio de 384 dimensiones. Para una consulta se embebe la pregunta y se recuperan los k fragmentos más similares, típicamente los 3 primeros, que actúan como contexto relevante para la generación.

Consulta y generación: una vez recuperados los trozos relevantes se construye un prompt fundamentado que se envía al modelo Llama 3 ejecutado por Ollama en local. Insistir en que el modelo responda solo con la información del contexto y que explique cuando algo no está en ese contexto reduce enormemente las alucinaciones y aumenta la fiabilidad de las respuestas.

Arquitectura de servidor: FastAPI expone endpoints limpios para subir documentos y realizar consultas, por ejemplo un endpoint para añadir archivos que procesa y almacena los trozos embebidos y otro para recibir consultas, recuperar fragmentos y delegar la generación al LLM. Esta separación facilita depurar y reemplazar componentes si se desea, por ejemplo cambiar Chroma por otro vector store o probar distintos modelos locales.

Interfaz de usuario: una pequeña aplicación Streamlit permite arrastrar y soltar archivos, escribir preguntas y mostrar respuestas con citas del fragmento recuperado. Un front sencillo transforma el proyecto en una herramienta práctica y accesible para uso personal o interno.

Lecciones aprendidas: trocear correctamente es un arte y marcar límites semánticos como párrafos o secciones ayuda; la calidad de los fragmentos recuperados importa más que la cantidad de ellos, tres fragmentos relevantes superan a diez vagos; promover la disciplina del prompt para que el modelo no invente resultados hace una diferencia crítica; y los modelos locales gestionados con herramientas como Ollama son hoy una alternativa madura, privada y sin costes por llamado API.

Implementar registro detallado en cada etapa —tamaños de trozos, puntuaciones de similitud, prompts finales y latencias del LLM— convierte la depuración en un proceso sistemático y reproducible.

En Q2BSTUDIO somos especialistas en desarrollar soluciones como esta a medida para empresas que necesitan privacidad, control y personalización. Ofrecemos servicios de desarrollo de aplicaciones a medida y software a medida, además de soluciones de inteligencia artificial para empresas, agentes IA y sistemas de automatización. Si tu objetivo es crear un asistente RAG privado o integrar modelos locales en tus procesos, nuestro equipo puede ayudarte con diseño, integración y despliegue.

También cubrimos áreas complementarias necesarias en proyectos productivos, desde ciberseguridad y pruebas de pentesting hasta despliegues en la nube con servicios cloud aws y azure y soluciones de inteligencia de negocio y power bi para explotación de datos. Consulta nuestros servicios de desarrollo de aplicaciones en aplicaciones a medida o descubre cómo aprovechamos la inteligencia artificial en soluciones de IA para empresas.

Posibles mejoras y siguientes pasos: añadir citación de fuentes en las respuestas, soportar más tipos de archivo como Word o HTML, experimentar con distintos modelos de embeddings y añadir caching o autenticación para entornos multiusuario. Un enfoque modular permite iterar rápidamente y adaptar la arquitectura a necesidades concretas de negocio.

Conclusión: montar un RAG local con Ollama y FastAPI es una forma poderosa de convertir tus documentos privados en una fuente consultable y accionable por IA sin depender de terceros. Si necesitas asistencia para diseñar o desplegar una solución así en tu organización, Q2BSTUDIO puede acompañarte en todo el ciclo, desde la prueba de concepto hasta la producción, garantizando seguridad, rendimiento y adaptación a tus requerimientos de negocio.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.