Els vehicles autònoms necessiten percebre l'entorn amb rapidesa i precisió. No obstant, la percepció en temps real és un repte quan els models processen milions de punts LiDAR i imatges d'alta resolució. La solució està en fusions de sensors, quantització de models i acceleració amb TensorRT.
A Q2BSTUDIO, empresa especialitzada en desenvolupament i serveis tecnològics, vam optimitzar un model de percepció multi-modal aconseguint un rendiment 40% més ràpid, mantenint la precisió necessària per detectar vianants i obstacles a la carretera.
El repte rau en la combinació de LiDAR i càmeres. Mentre que LiDAR proporciona estimacions de profunditat precises, genera milions de punts per segon. Per la seva banda, les càmeres ofereixen detalls de textura i color però manquen de profunditat. Fusionar ambdós sensors exigeix equilibri entre velocitat i precisió.
Un dels problemes més complexos va ser la desincronització de dades. LiDAR i la càmera no capturen informació simultàniament, provocant desajustos en la posició dels objectes. Per resoldre-ho, vam implementar compensació de moviment ego utilitzant filtres de Kalman, reduint la desalineació en un 85% i millorant la precisió en la detecció d'objectes en moviment.
Un altre obstacle era la fusió de dades de sensors en una única representació. Per abordar aquest problema, vam desenvolupar un model de vista zenital (Bird's Eye View, BEV) que projecta els punts LiDAR en el pla d'imatge de la càmera. Aquest enfocament va incloure:
- Calibració de LiDAR i càmera amb matrius de transformació.
- Projecció de punts LiDAR en l'espai d'imatge.
- Fusió de característiques amb un transformer d'atenció creuada.
Gràcies a aquesta solució, vam millorar la detecció en un 29%, permetent al model comprendre millor el seu entorn.
Tot i la fusió eficient de dades, la inferència encara necessitava optimització. Vam reduir temps de processament mitjançant quantització amb TensorRT. La transformació de models de PyTorch a TensorRT, juntament amb la conversió de càlculs de precisió FP32 a INT8, ens va permetre:
- Reduir el temps d'inferència de 250ms a 75ms per fotograma.
- Disminuir l'ús de memòria en un 40%.
- Millorar el rendiment en temps real a 5 FPS.
A Q2BSTUDIO, seguim explorant models d'aprenentatge d'extrem a extrem, on la percepció i la planificació convergeixen en una única xarxa neuronal. Aquests models podrien revolucionar la navegació autònoma, tot i que encara requereixen conjunts de dades massius i solucions per millorar la seva interpretabilitat.
Amb la combinació de fusió de sensors, correcció de moviment i optimització amb TensorRT, vam aconseguir que la IA per a vehicles autònoms sigui més ràpida i eficient. El nostre següent pas és continuar escalant aquestes solucions i aplicar-les en escenaris del món real.
A Q2BSTUDIO, treballem amb tecnologies avançades per oferir solucions d'avantguarda en el sector de la intel·ligència artificial i els vehicles autònoms. Si estàs buscant optimitzar els teus models de percepció per millorar la velocitat i la precisió, contacta'ns.




