Codi obert

El BSC publica Salamandra-TAV-7b, un model obert que tradueix la veu en sis llengües ibèriques

El Barcelona Supercomputing Center ha publicat a Hugging Face un model de 7.800 milions de paràmetres dedicat en exclusiva a la traducció de veu. Cobreix l'asturià, l'èuscar, el català, el gallec, el portuguès, el castellà i l'anglès amb llicència Apache 2.0 i sense restriccions d'accés, cosa que en permet l'ús comercial. És una aposta per les llengües peninsulars en un terreny dominat per models anglocèntrics.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

En resum

  • Salamandra-TAV-7b té 7.776.505.856 paràmetres en precisió BF16, és a dir, uns 7,8 mil milions.
  • Es distribueix amb llicència Apache 2.0 i sense restricció d'accés, tant per a recerca com per a ús comercial.
  • Resol quatre tasques: ASR (reconeixement automàtic de la parla), traducció de text a text, traducció de veu a text i identificació de la llengua parlada.
  • L'entrenament suma 12.000 hores d'ASR, 900 hores de traducció de veu a text i 113 milions de tokens objectiu de traducció escrita.

Un model especialitzat que renuncia a conversar

La fitxa oficial del model no deixa lloc a dubtes: aquesta versió de Salamandra està pensada només per a tasques de traducció de veu, no sap mantenir una conversa i no s'ha entrenat amb instruccions conversacionals. No és una mancança imprevista, sinó una decisió de disseny que concentra tota la capacitat del model en un sol ofici.

El punt de partida és BSC-LT/salamandraTA-7b-instruct, el model base de la família orientat a la traducció. A sobre, l'equip del BSC hi ha afegit la comprensió de l'àudio perquè el sistema pugui escoltar una intervenció en gallec i tornar-la escrita en anglès, o transcriure directament el que s'ha dit en èuscar sense passar per cap traducció intermèdia.

Les llengües ibèriques entren a la traducció de veu de codi obert

El model treballa amb sis llengües ibèriques més l'anglès: asturià, èuscar, català, gallec, portuguès, castellà i anglès. Aquesta cobertura és l'aportació més singular del llançament, perquè l'asturià i el gallec gairebé no apareixen als grans sistemes comercials de traducció de veu i, quan hi són, acostumen a rendir molt per sota de les llengües majoritàries.

Per mesurar el resultat, l'avaluació es compara amb SeamlessM4T, el model multimodal de referència en traducció directa de veu. L'equip explica a més una precaució metodològica important: van excloure de l'entrenament les mostres que se solapaven entre Common Voice 21.0 i els conjunts dev i test de CoVoST 2, dos corpus públics habituals en aquest camp. Sense aquesta neteja, les xifres d'avaluació quedarien inflades per dades que el model ja hauria vist.

Una variant transcriu abans de traduir

Al costat del model principal se'n distribueix una variant que fa servir un mecanisme de CoT (cadena de pensament), la tècnica que obliga el model a desglossar el seu raonament en passos intermedis. Aquí s'aplica d'una manera molt concreta: el sistema transcriu primer el que ha sentit i tradueix després a partir d'aquesta transcripció.

Aquest pas de més té un cost en temps de resposta, però ofereix dos avantatges pràctics. La transcripció intermèdia queda a la vista, de manera que es pot comprovar on ha fallat el sistema quan la traducció no quadra; i separar l'escolta de la traducció acostuma a reduir els errors en àudios amb soroll o amb accents poc representats a les dades.

El repartiment d'hores d'entrenament explica l'enfocament: 12.000 hores dedicades a ASR davant de 900 de traducció de veu a text. Els 113 milions de tokens objectiu de traducció escrita fan una funció de conservació, perquè serveixen per mantenir el rendiment del model original en text mentre se li afegeix la nova capacitat d'àudio.

La llicència obre la porta a l'ús professional

La combinació d'Apache 2.0 i absència de restricció d'accés no és un detall menor. Permet descarregar els pesos, ajustar-los, integrar-los en un producte i vendre'l sense negociar condicions ni acceptar clàusules d'ús acceptable, cosa que no passa amb bona part dels models etiquetats com a oberts.

Per a una administració autonòmica, un servei de subtitulació o una empresa d'accessibilitat que treballi en català, èuscar o gallec, un model de 7.800 milions de paràmetres és a més manegable: cap en una sola GPU de gamma raonable i es pot executar en infraestructura pròpia, sense enviar l'àudio dels usuaris a cap servei extern.

Conclusió

Salamandra-TAV-7b no competeix per encapçalar les classificacions generalistes, i tampoc ho pretén. El seu valor és cobrir amb dades, avaluació honesta i llicència permissiva un buit que el mercat no té cap incentiu per omplir: la traducció de veu en llengües amb pocs milions de parlants. Queda per veure com es comporta fora del laboratori, amb àudio real, soroll de fons i parlants de diferents edats i procedències, perquè és aquí on aquests sistemes solen perdre la brillantor dels resultats publicats. Si el BSC manté el ritme d'actualitzacions de la família Salamandra, el resultat més durador d'aquest llançament pot ser menys tècnic que estratègic: demostrar que la infraestructura pública europea és capaç de sostenir models útils per a les llengües que ningú més no atendrà.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog