Inferència asíncrona ràpid-lent per a conducció autònoma

Reduïm la bretxa entre raonament lent i control ràpid en conducció autònoma. Nova arquitectura asíncrona millora un 94% la finalització de rutes.

domingo, 26 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Arquitectura fast-slow: piensa a 5 Hz, actúa a 20 Hz

La conducció autònoma basada en models de llenguatge de gran escala (LLM) ha demostrat una capacitat impressionant per seguir instruccions i raonar sobre escenes complexes. No obstant, el principal coll d'ampolla continua sent la latència d'inferència: un model de 7 mil milions de paràmetres no pot executar-se a la velocitat que un vehicle necessita per controlar la direcció i acceleració cada 50 mil·lisegons. Les solucions actuals sovint salten ticks de simulació, reutilitzant ordres antigues i generant una sortida de control que ignora les dades més recents fins a la meitat de les ocasions. Aquest compromís entre precisió i velocitat limita severament el rendiment en rutes realistes.

Davant d'aquest repte, emergeix una arquitectura innovadora que separa les capacitats de raonament lent de la reacció ràpida. El sistema lent, un backbone de visió-llenguatge congelat de 7B paràmetres, processa instruccions de navegació i història visual a baixa freqüència, però exposa la seva memòria cau de clau-valor per capa com una representació persistent de l'escena. El sistema ràpid, un expert en accions lleuger, atén a aquesta memòria cau i al fotograma actual de la càmera a cada tick de simulació, generant waypoints en una única passada cap endavant. La clau és entrenar l'expert amb vetustat aleatòria, simulant el desfasament temporal que es produeix en desplegament real, alineant així l'entrenament amb l'execució asíncrona.

Aquesta arquitectura ràpid-lent no només elimina la necessitat de saltar ticks, sinó que permet que cada ordre de control es basi en l'observació més recent. En proves realitzades amb l'entorn CARLA i rutes LangAuto-Short, el sistema produeix control fresc cada 50 ms, millorant la finalització de rutes d'un 37.0 % (línia base amb salt de fotogrames) a un 94.0 %. Una anàlisi d'ablació revela que l'expert per si mateix eleva la puntuació de conducció, però la frescor per tick afegeix un salt addicional de 82.1 % a 94.0 % i redueix les infraccions de semàfor en vermell en un terç. A més, entrenat en una sola ciutat, l'expert es transfereix a dues ciutats no vistes mantenint un 84-94 % de finalització, enfront del 31-41 % de la línia base. L'error de waypoint en mode obert es redueix quasi quatre vegades respecte al propi capçal d'acció del backbone, amb un cost per tick de només 32 ms en una GPU de consum.

Des d'una perspectiva tècnica, aquesta aproximació representa un canvi de paradigma en el desplegament d'intel·ligència artificial en sistemes crítics de temps real. En lloc de forçar un model enorme a executar-se a altes freqüències, es desacoblen les tasques: el raonament semàntic i la comprensió contextual es realitzen a baixa freqüència, mentre que la predicció de trajectòries i el control motor s'executen a alta freqüència aprofitant representacions precomputades. Aquest disseny no només és més eficient, sinó que també és més robust davant de la latència de xarxa i les variacions en la càrrega computacional.

En el context empresarial, aquesta arquitectura té implicacions directes per al desenvolupament de solucions de mobilitat autònoma, però també per a qualsevol aplicació que requereixi combinar raonament complex amb resposta en temps real, com robots de servei, assistents virtuals o sistemes de monitorització industrial. La clau està en saber dissenyar la interfície entre els dos sistemes: la memòria cau de coneixement compartit. A Q2BSTUDIO, com a empresa especialitzada en intel·ligència artificial i serveis cloud AWS/Azure, entenem que la integració de models grans amb sistemes lleugers requereix una orquestració acurada de la infraestructura. Per exemple, desplegar el backbone en instàncies cloud amb GPUs dedicades i l'expert en dispositius edge amb acceleradors lleugers permet un flux de treball asíncron que maximitza la frescor de les decisions sense sacrificar la capacitat de raonament.

A més, la tècnica d'entrenament amb vetustat aleatòria és transferible a altres dominis on existeixi un desfasament entre la generació de representacions i el seu ús. En projectes d'anàlisi en temps real, com panells de Business Intelligence (BI) o sistemes de ciberseguretat, l'actualització asíncrona de dades històriques combinada amb processament immediat d'esdeveniments pot millorar significativament la capacitat de resposta. De fet, a Q2BSTUDIO apliquem principis similars en desenvolupar aplicacions a mida que requereixen processar grans volums de dades al núvol i reaccionar localment amb baixa latència.

Un altre aspecte rellevant és la capacitat de transferència zero-shot de l'expert a entorns no vistos. Això suggereix que la memòria cau del backbone codifica representacions suficientment genèriques de l'espai de conducció, cosa que permet que l'expert aprengui polítiques adaptables sense necessitat de reentrenament costós. A la pràctica, això redueix dràsticament els requisits de dades per a nous escenaris, un factor crític en l'adopció de sistemes autònoms.

Quant a la infraestructura cloud, la capacitat d'executar el backbone en AWS o Azure amb escalat automàtic i l'expert al vehicle o edge minimitza els costos operatius. La latència de 32 ms per tick en una GPU de consum demostra que és viable fins i tot amb maquinari assequible, rebaixant les barreres d'entrada per a startups i centres de recerca. Des de Q2BSTUDIO, oferim consultoria i desenvolupament de solucions d'intel·ligència artificial i cloud que integren aquestes arquitectures asíncrones, ajudant empreses a implementar sistemes de decisió en temps real sense comprometre la precisió.

Finalment, cal destacar que la seguretat i la ciberseguretat són aspectes fonamentals en sistemes autònoms. Un sistema ràpid-lent pot dissenyar-se amb capes de seguretat: l'expert lleuger, en tenir una superfície d'atac menor, pot ser auditat més fàcilment, mentre que el backbone, en executar-se al núvol, pot beneficiar-se de mesures de ciberseguretat avançada com xifrat en trànsit, autenticació multifactor i monitorització contínua. Q2BSTUDIO integra aquestes pràctiques en tots els seus projectes, garantint que la innovació tecnològica vagi acompanyada de la protecció necessària.

En resum, l'arquitectura d'inferència asíncrona ràpid-lent resol un dels problemes més urgents de la conducció autònoma basada en LLM: la latència. Al separar el raonament lent de la reacció ràpida, i entrenar l'expert amb desfasaments simulats, s'aconsegueix un control fresc i eficient que multiplica el rendiment. Aquesta filosofia de disseny té aplicacions més enllà de l'automòbil, en qualsevol àmbit on la intel·ligència artificial hagi de combinar comprensió profunda amb resposta immediata. A Q2BSTUDIO, estem compromesos a portar aquestes solucions als nostres clients, integrant intel·ligència artificial, cloud i desenvolupament de programari a mida per transformar idees en realitats operatives.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.