En l'ecosistema de la conducció autònoma, un dels reptes més complexos és gestionar la incertesa dels agents que no són visibles directament per als sensors del vehicle. Cantonades, vehicles estacionats o fins i tot condicions meteorològiques adverses generen zones ocultes on vianants, ciclistes o altres automòbils poden aparèixer de forma sobtada. Els enfocaments tradicionals solen aplicar un criteri uniforme de precaució davant de qualsevol oclusió, cosa que deriva en maniobres excessivament defensives que penalitzen l'eficiència i el confort. O bé, intenten modelar l'espai ocult sense avaluar realment com aquesta informació impacta en la planificació de la ruta. Per resoldre aquesta bretxa entre percepció i decisió, sorgeixen aproximacions basades en models de llenguatge visual (VLM, per les sigles en anglès) que no només detecten la presència d'agents ocults, sinó que prioritzen aquells el comportament dels quals altera significativament la trajectòria prevista.
La clau està a mesurar quant canviaria el pla del vehicle si es conegués l'existència d'un agent ocult. Utilitzant una mètrica de divergència KL de planificació (PKL), es pot quantificar, des d'un punt de vista informacional, l'impacte de cada oclusió sobre la ruta òptima. Aquest rànquing permet a un VLM expert —com els models d'última generació d'OpenAI— generar anotacions riques i estructurades sobre l'evidència visual i el raonament necessari per integrar aquests agents en la presa de decisions. El resultat és un conjunt de dades d'entrenament molt més rellevant, que ensenya a models més petits a centrar-se en allò veritablement crític, aconseguint que superin fins i tot versions zero dispar molt més grans. En proves sobre el conjunt nuScenes, l'estratègia de selecció de dades guiada per PKL va millorar el rendiment fins a un 30% enfront del mostreig aleatori.
Més enllà de l'àmbit automotriu, aquest principi de priorització basada en l'impacte sobre el planificador té aplicacions en múltiples dominis. En robòtica mòbil, logística o fins i tot en sistemes de vigilància intel·ligent, la capacitat d'identificar ràpidament quins elements de l'entorn són realment decisius per a l'acció permet optimitzar recursos computacionals i millorar la seguretat. És aquí on la aplicació a mida d'intel·ligència artificial i agents IA cobra especial rellevància. A Q2BSTUDIO desenvolupem programari a mida que integra models de llenguatge visual amb motors de planificació, adaptant-los a les necessitats específiques de cada client. La nostra experiència abasta des de la implementació de serveis cloud AWS i Azure per escalar el processament de vídeo en temps real, fins a la ciberseguretat necessària per protegir les comunicacions entre sensors i sistemes de decisió. A més, combinem aquestes capacitats amb serveis d'intel·ligència de negoci com Power BI per monitoritzar mètriques de rendiment i patrons de risc en entorns dinàmics.
La IA per a empreses que oferim no es limita a implementar algoritmes; dissenyem arquitectures completes on la visió per computador i el processament del llenguatge natural treballen de forma conjunta. Per exemple, en un sistema de gestió de flotes autònomes, un VLM pot detectar un vianant ocult darrere d'un camió estacionat i, mitjançant un raonament causal, suggerir una maniobra evasiva. El vehicle no només reacciona, sinó que anticipa. Aquest tipus de solucions requereixen un desenvolupament multidisciplinari que abasta des de la ingesta de dades fins a l'orquestració de microserveis al núvol. En aquest context, els nostres experts integren plataformes d'intel·ligència artificial amb pipelines de dades escalables i segurs, garantint que cada decisió estigui recolzada per informació rellevant i processada amb la latència adequada.
La investigació actual demostra que entrenar models més petits amb dades seleccionades de forma intel·ligent pot igualar o superar arquitectures massives que no tenen aquest refinament. Per a les empreses que busquen adoptar tecnologies de conducció autònoma o automatització avançada, això suposa una oportunitat clara: no sempre es necessita el model més gran, sinó el millor entrenat i contextualitzat. La incorporació de mètriques com la divergència PKL permet construir sistemes de percepció conscients de la presa de decisions, un salt qualitatiu enfront dels enfocaments clàssics. A Q2BSTUDIO, acompanyem les organitzacions en aquest camí, desenvolupant aplicacions a mida que converteixen la incertesa en una variable gestionable. Des de la simulació d'escenaris complexos fins a la posada en producció de models de llenguatge visual, el nostre equip combina enginyeria de programari, ciència de dades i una visió estratègica per habilitar la pròxima generació de sistemes autònoms segurs i eficients.

.jpg)



