Extracció estructurada on-premise amb LLM i Ollama

Aprèn a extreure dades estructurades de documents Markdown i PDF utilitzant Ollama i CocoIndex amb només ~100 línies de codi en Python. Executa models LLM localment i crea índexs de dades eficients.

viernes, 21 de marzo de 2025 • 2 min de lectura • Equip Q2BSTUDIO

Empresa-Software-Apps

En aquest blog, et mostrarem com utilitzar Ollama per extreure dades estructurades de manera local i desplegar-les al teu propi núvol o servidor.

Utilitzarem documentació en format PDF de Python com a exemple. Amb només aproximadament 100 línies de codi en Python, pots realitzar aquest procés de manera eficient.

Ollama permet executar models de llenguatge de gran escala (LLM) al teu ordinador de forma senzilla. Per començar, descarrega i instal·la Ollama i després executa la següent ordre per obtenir el teu model LLM favorit:

ollama pull llama3.2

Definim l'estructura de les dades a extreure del document de Python, organitzant-les en classes que contenen informació sobre mòduls, classes, mètodes i arguments.

Després, establim el flux d'extracció utilitzant CocoIndex per processar els documents en format Markdown. La funció d'extracció amb LLM pren com a entrada el contingut del document i retorna dades estructurades en un format definit.

Un cop extreta la informació, la podem emmagatzemar en una base de dades PostgreSQL per a la seva posterior consulta i anàlisi.

Per provar l'extracció, simplement executa aquestes ordres:

python main.py cocoindex setup
python main.py cocoindex update

Després de completar aquest procés, podràs consultar la informació emmagatzemada a la base de dades i analitzar-la a través de consultes SQL.

A Q2BStudio, una empresa especialitzada en desenvolupament i serveis tecnològics, ajudem les organitzacions a implementar solucions avançades de processament de dades i automatització utilitzant intel·ligència artificial. Si busques optimitzar la gestió de la teva informació i aprofitar el poder de la intel·ligència artificial a la teva empresa, contacta'ns.

També explorem com convertir fitxers PDF a Markdown per extreure dades estructurades, utilitzant funcions personalitzades dins de CocoIndex. Això permet integrar fàcilment l'extracció de textos en diferents formats dins d'un flux de dades automatitzat.

A Q2BStudio, treballem amb tecnologies que faciliten la gestió i transformació de dades, oferint solucions innovadores a empreses de diferents sectors. Si necessites assistència per implementar processos avançats d'extracció i anàlisi de dades, el nostre equip està preparat per ajudar-te.

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.