Diffusion-gemma-asr-small: model ASR de difusió per a sis idiomes

Primer model ASR de difusió multilingüe open-source. Transcriu sis idiomes amb només 42M paràmetres. Supera models de difusió similars.

viernes, 3 de julio de 2026 • 2 min de lectura • Equip Q2BSTUDIO

El primer model ASR de difusió multilingüe open-source

EL reconeixement de veu ha fet un salt significatiu amb l'arribada de models basats en difusió, una alternativa als tradicionals sistemes autorregressius. El nou diffusion-gemma-asr-small, desenvolupat per Interfaze i recolzat per Y Combinator, representa el primer model ASR de difusió multilingüe de codi obert. Aquest sistema és capaç de transcriure sis idiomes —anglès, alemany, francès, espanyol, hindi i mandarí— utilitzant un únic adaptador de només 42 milions de paràmetres, aprofitant l'arquitectura de difusió discreta de DiffusionGemma, un model de 26B paràmetres amb mescla d'experts.

A diferència dels models autorregressius que generen text token per token, l'enfocament de difusió refina tots els tokens en paral·lel a través de passos de denoising. Això ofereix avantatges en latència previsible: el cost de transcripció depèn del nombre de passos, no de la longitud de l'àudio. En les proves sobre LibriSpeech, el model assoleix un WER del 6,6%, superant altres sistemes de difusió com Whisfusion, tot i que encara per darrere de Whisper en mode autorregressiu. La capacitat d'escalar amb un nombre reduït de passos (vuit en són suficients per a resultats gairebé òptims) el converteix en una opció eficient per a processos per lots.

Darrere d'aquest avenç hi ha una enginyeria acurada: s'utilitza un codificador Whisper-small congelat per extreure característiques acústiques, un projector entrenable que comprimeix les seqüències i un mecanisme de pèrdua CTC per alinear l'àudio amb el text. Aquest disseny va resoldre el problema inicial de gradients nuls que impedia l'aprenentatge del projector. Per a empreses que busquen implementar solucions de veu escalables, aquest model obre la porta a transcripcions multilingües sense necessitat de carregar models separats per idioma, reduint costos operatius i facilitant la integració en fluxos de treball existents.

A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que la intel·ligència artificial aplicada al processament del llenguatge natural és només una peça de l'ecosistema digital. Oferim serveis de ia per a empreses que abasten des de la integració de models open-source com aquest fins al desenvolupament d'aplicacions a mida que connecten veu, dades i processos de negoci. La nostra experiència en serveis cloud AWS i Azure permet desplegar aquests sistemes amb alta disponibilitat i seguretat, mentre que les nostres solucions d'intel·ligència de negoci, com Power BI, transformen les transcripcions en insights accionables. També proporcionem serveis de ciberseguretat per protegir les dades sensibles que flueixen en aquests pipelines.

Per a les organitzacions que exploren l'automatització mitjançant agents IA, models com diffusion-gemma-asr-small demostren que la innovació oberta accelera l'adopció tecnològica. La clau està a saber combinar-los amb infraestructura robusta i estratègies de dades ben definides. A Q2BSTUDIO ajudem les empreses a fer aquest pas, integrant programari a mida que maximitza el valor d'aquestes eines d'avantguarda.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.