Código abierto

El BSC publica Salamandra-TAV-7b, un modelo abierto que traduce voz en seis lenguas ibéricas

El Barcelona Supercomputing Center ha publicado en Hugging Face un modelo de 7.800 millones de parámetros dedicado en exclusiva a la traducción de voz. Cubre asturiano, euskera, catalán, gallego, portugués, español e inglés con licencia Apache 2.0 y sin restricciones de acceso, lo que permite su uso comercial. Es una apuesta por las lenguas peninsulares en un terreno dominado por modelos anglocéntricos.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

El BSC publica Salamandra-TAV-7b, un modelo abierto que traduce voz en seis lenguas ibéricas
📷 BSC-LT · diferencias XCOMET-XL entre lenguas ibéricas · fuente

En resumen

  • Salamandra-TAV-7b suma 7.776.505.856 parámetros en precisión BF16, es decir, unos 7,8 mil millones.
  • Se distribuye con licencia Apache 2.0 y sin restricción de acceso, tanto para investigación como para uso comercial.
  • Resuelve cuatro tareas: ASR (reconocimiento automático del habla), traducción de texto a texto, traducción de voz a texto e identificación de la lengua hablada.
  • El entrenamiento suma 12.000 horas de ASR, 900 horas de traducción voz a texto y 113 millones de tokens objetivo de traducción escrita.

Un modelo especializado que renuncia a conversar

La ficha oficial del modelo es tajante en su planteamiento: esta versión de Salamandra está pensada exclusivamente para tareas de traducción de voz, carece de capacidades de chat y no se ha entrenado con instrucciones conversacionales. No es una limitación imprevista, sino una decisión de diseño que concentra toda la capacidad del modelo en un único oficio.

El punto de partida es BSC-LT/salamandraTA-7b-instruct, el modelo base de la familia orientado a traducción. Sobre él, el equipo del BSC ha añadido la comprensión del audio para que el sistema pueda escuchar una intervención en gallego y devolverla escrita en inglés, o transcribir directamente lo dicho en euskera sin pasar por una traducción intermedia.

Las lenguas ibéricas entran en la traducción de voz de código abierto

El modelo trabaja con seis lenguas ibéricas más el inglés: asturiano, euskera, catalán, gallego, portugués, español e inglés. Esa cobertura es la aportación más singular del lanzamiento, porque el asturiano y el gallego apenas aparecen en los grandes sistemas comerciales de traducción de voz, y cuando lo hacen suelen rendir muy por debajo de los idiomas mayoritarios.

Para medir el resultado, la evaluación se compara con SeamlessM4T, el modelo multimodal de referencia en traducción directa de voz. El equipo detalla además una precaución metodológica relevante: se excluyeron del entrenamiento las muestras solapadas entre Common Voice 21.0 y los conjuntos dev y test de CoVoST 2, dos corpus públicos habituales en este campo. Sin esa limpieza, las cifras de evaluación quedarían infladas por datos ya vistos.

Una variante transcribe antes de traducir

Junto al modelo principal se distribuye una variante que emplea un mecanismo de CoT (cadena de pensamiento), la técnica que obliga al modelo a desglosar su razonamiento en pasos intermedios. Aquí se aplica de forma muy concreta: el sistema transcribe primero lo que ha oído y traduce después a partir de esa transcripción.

Ese paso adicional tiene un coste en tiempo de respuesta, pero ofrece dos ventajas prácticas. La transcripción intermedia queda a la vista, de modo que se puede auditar dónde ha fallado el sistema cuando la traducción no cuadra, y separar la escucha de la traducción suele reducir los errores en audios con ruido o con acentos poco representados en los datos.

El reparto de horas de entrenamiento explica el enfoque: 12.000 horas dedicadas a ASR frente a 900 de traducción voz a texto. Los 113 millones de tokens objetivo de traducción escrita cumplen una función de conservación, ya que sirven para mantener el rendimiento del modelo original en texto mientras se le añade la nueva capacidad de audio.

La licencia abre la puerta al uso profesional

La combinación de Apache 2.0 y ausencia de restricción de acceso no es un detalle menor. Permite descargar los pesos, ajustarlos, integrarlos en un producto y venderlo sin negociar condiciones ni aceptar cláusulas de uso aceptable, algo que no ocurre con buena parte de los modelos etiquetados como abiertos.

Para una administración autonómica, un servicio de subtitulado o una empresa de accesibilidad que trabaje en catalán, euskera o gallego, un modelo de 7.800 millones de parámetros resulta además manejable: cabe en una sola GPU de gama razonable y puede ejecutarse en infraestructura propia, sin enviar el audio de los usuarios a un servicio externo.

Conclusión

Salamandra-TAV-7b no compite por encabezar las clasificaciones generalistas, y no lo pretende. Su valor está en cubrir con datos, evaluación honesta y licencia permisiva un hueco que el mercado no tiene incentivos para llenar: la traducción de voz en lenguas con pocos millones de hablantes. Queda por ver cómo se comporta fuera del laboratorio, con audio real, ruido de fondo y hablantes de distintas edades y procedencias, porque ahí es donde estos sistemas suelen perder el brillo de los resultados publicados. Si el BSC mantiene el ritmo de actualizaciones sobre la familia Salamandra, el resultado más duradero de este lanzamiento puede ser menos técnico que estratégico: demostrar que la infraestructura pública europea es capaz de sostener modelos útiles para las lenguas que nadie más va a atender.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog