MiLSD: detecció de segments de línia per a dispositius limitats

Descobreix MiLSD, un detector de segments de línia ultralleuger per a MCUs amb precisió i menys d'1 MB.

viernes, 31 de julio de 2026 • 6 min de lectura • Equip Q2BSTUDIO

Detección de líneas en MCUs con precisión y menos de 1 MB

La detecció de segments de línia és una tasca fonamental en visió artificial, però la seva implementació en dispositius amb recursos limitats continua sent un repte. Els robots mòbils, els sistemes de realitat augmentada i les càmeres d'inspecció industrial necessiten entendre la geometria d'una escena sense dependre de servidors externs. En aquest context, un model de deep learning ha d'oferir precisió amb molt poca memòria, perquè els microcontroladors de baix cost no poden carregar desenes de megabytes de paràmetres.

Les solucions comercials habituals s'entrenen en GPU i s'executen en equips potents. En traslladar-les a un microcontrolador, el model ha de conviure amb el sistema operatiu en temps real, el buffer de la càmera i les tasques de control. Per això no n'hi ha prou de reduir el nombre de capes; cal repensar la representació de sortida i el procés d'inferència. Un estudi recent explora aquest límit: quina és la precisió màxima que es pot assolir amb menys d'un megabyte? La resposta afecta directament aplicacions com el SLAM visual, la reconstrucció 3D i la inspecció industrial, on els segments de línia són una pista geomètrica de gran valor.

La proposta MiLSD parteix d'un backbone totalment convolucional i compacte. En lloc de predir directament els segments complets, compara diverses representacions de sortida. La més efectiva, anomenada F-Clip, codifica cada segment a partir del seu centre, la seva longitud i el seu angle. Aquesta formulació simplifica l'aprenentatge en models petits i evita que la xarxa dispersi la capacitat en tasques ambigües. El resultat és que la representació importa tant com l'arquitectura, especialment quan el pressupost de memòria és de pocs centenars de kilobytes.

La quantització és un altre factor crític. Reduir els pesos a 8 bits manté el comportament del model en precisió completa, cosa que converteix aquesta opció en una decisió raonable per a microcontroladors amb memòria flash ajustada. En canvi, baixar a 4 bits introdueix una pèrdua notable de qualitat, sobretot en la regressió de l'angle. L'entrenament conscient de la quantització ajuda, però no compensa completament el dany. Això indica que l'arquitectura i la representació de sortida s'han de dissenyar pensant en la quantització des de l'inici, no com una etapa final.

També s'observa que el post-processament aporta una part important del rendiment. El decodificat subpíxel refina les coordenades dels centres; l'augment de dades en inferència fa que el model sigui més robust a petites variacions; i un verificador lleuger elimina falsos positius sense afegir un cost excessiu. Amb aquestes millores, la mètrica sAP10 sobre el conjunt ShanghaiTech Wireframe passa de 10,6, amb un model de 25 000 paràmetres i 0,25 MB, a 24,1 dins d'un pressupost d'1 MB. És un avenç significatiu per a sistemes encastats.

Un aspecte que sovint es subestima és el consum de memòria durant la inferència. No n'hi ha prou que els pesos caben en la memòria flash; les activacions intermèdies també ocupen RAM. El disseny totalment convolucional de MiLSD és decisiu perquè evita les capes denses que disparen el nombre de paràmetres i fa que el cost de còmput sigui previsible. A més, el pressupost d'activacions actua com una restricció de disseny: un cop coneguda la memòria màxima disponible, es pot fixar l'amplada de cada capa i la mida de les feature maps abans d'entrenar. Aquesta disciplina és habitual en el desenvolupament de programari per a sistemes encastats, on cada kilobyte compta.

Avaluar aquests models és delicat. La mètrica sAP10 mesura la concordança entre segments detectats i reals amb una tolerància de 10 píxels, i és especialment sensible als errors de longitud i d'angle. Per això, una millora en la regressió angular té un impacte directe en la puntuació final. En models de 4 bits, el deteriorament de l'orientació no només desplaça els segments, sinó que trenca la connectivitat visual de l'escena, cosa que resulta inacceptable en aplicacions com el SLAM.

Des d'una perspectiva empresarial, aquest tipus de recerca té aplicacions immediates. Les fàbriques intel·ligents, els vehicles autònoms i les plataformes de logística requereixen visió artificial a la vora, amb latència baixa i sense dependre d'una connexió contínua. A Q2BSTUDIO desenvolupem solucions de programari a mida per integrar aquests models en productes reals. El disseny d'una xarxa compacta no acaba en l'entrenament; necessita una enginyeria de desplegament que tingui en compte la memòria disponible, el consum energètic i l'actualització remota del firmware.

A més, els agents d'IA estan canviant la manera d'operar els sistemes de visió. Un agent pot supervisar una càmera, detectar anomalies i decidir si envia una imatge al núvol per a una anàlisi més profunda. Perquè aquest esquema funcioni, és imprescindible un model local ràpid i precís, com MiLSD, i una infraestructura d'IA que gestioni el cicle de vida complet del model. A Q2BSTUDIO acompanyem les empreses en el desplegament de solucions d'IA, des de la selecció de l'arquitectura fins a la integració amb els sistemes d'informació existents.

L'arquitectura cloud també hi juga un paper rellevant. Un dispositiu amb detecció de segments a la vora pot enviar esdeveniments rellevants a una infraestructura cloud AWS/Azure per entrenar models més potents o per correlacionar mesures al llarg del temps. Aquesta informació, un cop estructurada, alimenta quadres de comandament de BI/Power BI que permeten als responsables de producció prendre decisions basades en dades. Naturalment, qualsevol solució connectada ha d'incloure ciberseguretat des del disseny, perquè un microcontrolador vulnerable pot convertir-se en la porta d'entrada a tota la xarxa industrial. A Q2BSTUDIO integrem aquestes capacitats en projectes d'aplicacions a mida, combinant IA, cloud i seguretat en un mateix roadmap.

No podem oblidar la importància del MLOps en aquest tipus de projectes. Desplegar un model en un microcontrolador no és el final: cal monitoritzar el seu rendiment, actualitzar-lo quan canviï l'entorn i garantir que les decisions preses amb les seves sortides siguin auditables. Per això, les empreses que busquen un avantatge real necessiten combinar maquinari eficient, programari a mida i un equip que entengui el cicle de vida complet de la IA.

MiLSD no pretén substituir els grans models de GPU. El seu objectiu és omplir l'espai dels dispositius de baix cost, on la connectivitat és intermitent i el consum energètic és prioritari. En aquest escenari, l'equilibri entre precisió i memòria és més important que qualsevol rècord d'exactitud. Aquesta filosofia encaixa amb la tendència de l'edge computing: processar localment el que el núvol no necessita i enviar al núvol només el que aporta valor.

En definitiva, MiLSD demostra que l'alta precisió no és exclusiva dels grans sistemes. La combinació d'una representació de sortida ben triada, una quantització adequada i un post-processament eficient permet portar la detecció de segments de línia a dispositius de menys d'un megabyte. Per a les empreses, això suposa una oportunitat real d'incorporar visió per computador en productes econòmics, escalables i robustos. La clau és entendre el problema complet: no només el model, sinó també el dispositiu, les dades, el núvol i les persones que faran servir la informació. A Q2BSTUDIO treballem cada un d'aquests nivells perquè la tecnologia deixi de ser un experiment i es converteixi en un avantatge competitiu.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.