Imagineu demanar a un robot: Ei, recull la tassa vermella de la cuina i porta-la aquí.
Sembla senzill, oi? Però per a la intel·ligència artificial, això implica comprendre el llenguatge, navegar per l'espai, reconèixer objectes i fins i tot proporcionar retroalimentació en temps real.
Aquest va ser precisament el repte al Alexa Prize SimBot Challenge, on vam construir un agent conversacional amb capacitats avançades per entendre instruccions, moure's pel seu entorn, interactuar amb objectes i comunicar-se amb l'usuari.
A Q2BSTUDIO, una empresa especialitzada en desenvolupament i serveis tecnològics, treballem amb aquestes tendències innovadores per oferir solucions basades en intel·ligència artificial i aprenentatge automàtic. A continuació, expliquem com utilitzem BERT, l'aprenentatge per reforç i l'aprenentatge multimodal per fer que aquesta tecnologia funcioni.
Comprensió del llenguatge amb BERT
El llenguatge natural pot ser ambigu i complex. Un usuari pot dir Vés a la nevera o Troba la nevera i obre-la, i el robot ha de poder extreure el significat darrere de cada ordre.
Per abordar-ho, vam utilitzar BERT per convertir les instruccions en text en ordres estructurades que es poden executar seqüencialment, permetent que el robot realitzi les tasques sol·licitades sense marge d'error.
Resultats clau:
- 92% de precisió en l'assignació d'instruccions a tasques.
- Capacitat d'interpretar variacions en la redacció més enllà de regles predefinides.
- Millora en la interpretació de termes específics de l'entorn.
- Processament en temps real (<100ms per consulta).
Navegació amb planificació de rutes i aprenentatge per reforç
Després de comprendre una instrucció, el robot s'ha de desplaçar fins al seu destí. Vam implementar algorismes de cerca A* per a entorns estructurats i tècniques d'aprenentatge per reforç per a trajectòries en espais dinàmics.
Resultats clau:
- L'algorisme A* va aconseguir una navegació eficient en entorns controlats.
- L'aprenentatge per reforç va permetre ajustar la navegació en temps real.
- Es va accelerar el temps de desplaçament en un 40% en comparació amb algorismes tradicionals.
Reconeixement d'objectes i interacció
Un cop al seu destí, el robot ha d'identificar i manipular objectes. Per a això, vam entrenar un model basat en YOLOv8, especialitzat en la detecció en temps real d'elements com tasses, portes i electrodomèstics.
Resultats clau:
- Detecció en temps real a 30 FPS.
- 97% de precisió en la identificació d'objectes comuns.
- Capacitat per seguir instruccions detallades com Recull el llibre blau.
Retroalimentació en llenguatge natural
Més enllà d'executar tasques, el robot ha de proporcionar respostes clares a l'usuari. Per a això, vam utilitzar un model basat en GPT per generar respostes dinàmiques i fluides, amb l'objectiu de millorar la interacció humà-màquina.
Resultats clau:
- Retroalimentació adaptativa que va millorar l'experiència de l'usuari.
- 98% dels usuaris de prova van considerar naturals les respostes.
- Augment del 35% en la taxa de finalització de tasques.
Conclusió
La combinació de NLP avançat, planificació de rutes, detecció d'objectes en temps real i generació de llenguatge ens ha permès crear robots col·laboratius capaços de realitzar tasques amb precisió, aprendre de l'entorn i millorar la comunicació amb els usuaris.
A Q2BSTUDIO, apliquem aquestes tecnologies innovadores en solucions personalitzades per a diverses indústries, des de l'automatització fins a la millora de l'experiència de l'usuari amb IA avançada.




