Com funcionen els models moderns de veu a veu

Descobreix com funcionen els sistemes moderns de veu a veu: des de codecs neuronals fins a full-duplex, latència i arquitectures híbrides.

martes, 28 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Arquitectura y latencia en sistemas de voz a voz

La intel·ligència artificial conversacional ha fet un salt qualitatiu amb els models de veu a veu (V2V). Ja no es tracta de sistemes que transcriuen, processen text i després sintetitzen; ara l'audio entra i surt directament, conservant matisos com pauses, entonació i fins i tot interrupcions. Entendre com funcionen aquestes arquitectures és clau per a empreses que busquen integrar assistents de veu en els seus processos, ja sigui en atenció al client, automatització de tasques o aplicacions a mida.

La forma més simple de V2V és la cascada: un reconeixedor de veu (ASR) converteix l'audio en text, un model de llenguatge (LLM) genera la resposta i un sintetitzador (TTS) la vocalitza. Aquest enfocament és transparent, fàcil de depurar i permet substituir components, però perd tota la informació prosòdica —el to, el ritme, els sospirs— que no cap al text. Els sistemes nadius de veu, en canvi, treballen directament amb representacions discretes del so, com els tokens d'un codec neuronal. Per exemple, Mimi (de Kyutai) comprimeix un segon d'audio en 100 tokens distribuïts en vuit fluxos paral·lels. El model predictiu —un transformer autorregressiu— aprèn a generar aquests tokens seqüencialment, reconstruint després l'ona mitjançant un descodificador.

La representació de l'audio és crucial. L'ona mostrejada a 24 kHz requereix 24.000 punts per segon, cosa inviable per a un transformer per la seva atenció quadràtica. En canvi, un codec com EnCodec o DAC redueix la taxa a 50–75 trames per segon, cadascuna amb diversos índexs de quantització vectorial residual (RVQ). Això permet bitrates d'uns 2 kbit/s, 192 vegades menor que el PCM original, però amb pèrdues: els xiuxiuejos, els accents rars o els sorolls de fons poden degradar-se. No obstant això, la qualitat del codec limita la del sistema final, no la seva capacitat de comprensió.

Arquitectònicament, un model V2V típic té quatre blocs: un codificador d'entrada (que transforma l'ona en embeddings o tokens), un backbone transformer (que gestiona el context i la història), uns caps de sortida (que prediuen els tokens d'audio o text) i un descodificador d'audio (que reconstrueix l'ona). El backbone sol ser un LLM adaptat a audio, amb atenció causal i una memòria cau KV per evitar recalcular estats passats. En sistemes full-duplex com Moshi, dos fluxos d'audio (usuari i assistent) es modelen en paral·lel mitjançant un transformer temporal i un de profunditat, aconseguint latències d'uns 200 ms.

L'entrenament d'aquests models és costós. Primer s'entrena el codec amb objectius de reconstrucció, pèrdues adversàries i perceptives. Després es preentrena el model de llenguatge de veu sobre centenars de milers d'hores d'audio, sovint amb transcripcions automàtiques. Després s'alinea la representació del so amb el text mitjançant parells audio-transcripció, i finalment s'afina amb diàlegs i preferències humanes (RLHF). La seguretat també es treballa en aquesta fase, tot i que el control en producció requereix capes addicionals de filtres i polítiques d'eines.

En temps real, el major repte és la latència d'extrem a extrem. La detecció d'activitat de veu (VAD) decideix quan l'usuari ha acabat; un model de finalització de torn evita talls prematurs. El streaming envia fragments (20–240 ms) que el codificador processa incrementalment mentre el descodificador ja comença a generar resposta. El barge-in permet que l'usuari interrompi la reproducció; el full-duplex va més enllà i manté ambdós canals actius, modelant solapaments i retroalimentacions. Aquestes decisions de disseny afecten directament l'experiència d'usuari i el cost computacional.

La prosòdia i l'emoció són un altre front. Un model nadiu de veu pot captar el to, la velocitat i les pauses, però no interpreta emocions: només correlaciona patrons acústics amb respostes de l'entrenament. Gemini Live, per exemple, ofereix diàleg afectiu en versions concretes, però la majoria d'APIs tancades no garanteixen una lectura correcta de l'estat d'ànim. Per a aplicacions crítiques (banca, salut), és més segur ignorar la inferència emocional i centrar-se en respostes neutres i verificables. Aquí entra la ciberseguretat: evitar que un atacant injecti ordres de veu o cloni una identitat. Les solucions de ciberseguretat s'han d'integrar amb marques d'aigua i polítiques d'autenticació.

En l'àmbit empresarial, els models V2V estan transformant centres de contacte, assistents virtuals i sistemes d'automatització. Una empresa pot desplegar un agent de veu que entengui consultes complexes, accedeixi a bases de dades, executi accions i es comuniqui amb naturalitat. Tanmateix, l'avaluació ha de ser rigorosa: latència P95, precisió en noms i números, taxa d'èxit de tasques i cost per sessió. No n'hi ha prou que soni bé; ha de resoldre el problema del client.

A Q2BSTUDIO desenvolupem solucions de programari a mida que integren models de veu, intel·ligència artificial, cloud computing (AWS/Azure), Business Intelligence amb Power BI i automatització de processos. El nostre equip combina el coneixement tècnic de les arquitectures V2V amb l'experiència en desplegaments productius, garantint que la veu no només soni humana, sinó que compleixi els requisits de seguretat, latència i auditabilitat que exigeix el negoci. Si esteu avaluant incorporar veu a les vostres aplicacions, us ajudem a triar entre una cascada transparent o un sistema nadiu, sempre amb mètriques objectives i un enfocament pragmàtic.

El futur de la veu a veu passa per models multimodals (audio, text, imatge), eficiència en tokens i descodificadors més ràpids, i una millor gestió del context llarg. Les cascades no desapareixeran perquè ofereixen control i observabilitat; els sistemes nadius guanyaran en naturalitat. La clau és mesurar, no creure.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.