Código abierto

YuE2-3B genera y edita música con agentes en una sola GPU de 24 GB

El equipo de Multimodal Art Projection (m-a-p) ha publicado en Hugging Face YuE2-3B, un modelo abierto que convierte una letra y una descripción de estilo en una canción completa, con voz y acompañamiento, y que además muestra una partitura editable para retocar la melodía y la armonía. Según la documentación de sus autores, funciona en local con una GPU NVIDIA de 24 GB sin cuantización y produce audio estéreo a 48 kHz. Los pesos salen con licencia CC BY-NC 4.0, o sea, sin uso comercial.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

YuE2-3B genera y edita música con agentes en una sola GPU de 24 GB
📷 M.A.P / YuE2 · demostración oficial “From score to song” · fuente

En resumen

  • YuE2-3B es un modelo abierto de texto a música que m-a-p ha publicado en Hugging Face, con 4.000 millones de parámetros en formato BF16 y licencia CC BY-NC 4.0 (no comercial).
  • Compone canciones enteras con voz y acompañamiento a partir de una letra y un prompt de estilo, y entrega una partitura en formato ABC que el usuario puede modificar.
  • Pide Linux, Python 3.10 o superior y una GPU NVIDIA de 24 GB compatible con BF16; la ficha declara un pico de 11,18 GiB de VRAM en una RTX 4090.
  • El equipo mide 71 segundos para generar una canción de 3,6 minutos en una RTX 4090 con planificación completa.
  • En el banco de pruebas WildSongBench, las cifras que publican los autores dan a YuE2 (best-of-8) una media de 6,9632 frente al 6,8721 de Suno v5; son datos autorreportados, no una evaluación independiente.
  • Incorpora un flujo de edición con agentes: un agente traduce los comentarios musicales en cambios de partitura, estilo y letra, y el modelo vuelve a renderizar cada versión.

Qué es YuE2-3B y en qué se aparta del resto

YuE2-3B es la nueva entrega de la familia YuE, que desarrolla Multimodal Art Projection (m-a-p), y llega a Hugging Face como modelo abierto de text-to-audio (texto a audio). El planteamiento de partida resulta familiar: uno le da una letra y un prompt de estilo —una descripción escrita del sonido que busca— y el modelo devuelve una canción completa, con línea vocal y acompañamiento instrumental.

Lo que lo distingue de la mayoría de generadores musicales ocurre por el camino. YuE2 no salta del texto al audio de un tirón: primero escribe un plan simbólico, una partitura con melodía y acordes que el usuario puede leer, revisar y cambiar antes o después de sintetizar el sonido. Ese plan aparece en notación ABC, un formato de texto plano para escribir música, así que editarlo cuesta lo mismo que abrir un archivo.

Un solo parámetro decide cómo planifica. Con cot="full" el modelo traza melodía y acordes, que es la opción por defecto; con cot="melody" se limita a la melodía, la vía que sus autores aconsejan para hacer versiones; y con cot="off" genera de forma directa, sin plan simbólico de por medio.

Una arquitectura que escribe antes de sonar

La descripción técnica de la ficha explica que el sistema descansa en un único backbone de tipo Mixture-of-Transformers, con componentes AR y NAR —autorregresivo y no autorregresivo—, que escribe tanto la partitura como los tokens semánticos. Después, un proceso de flow matching genera los latentes acústicos y un VAE los traduce en audio estéreo.

Separar la planificación de la síntesis no es solo una decisión de diseño interno: el usuario la ve como dos APIs distintas. El método pipe.plan() devuelve el plan simbólico sin generar todavía el audio, de modo que se puede inspeccionar y corregir la estructura musical antes de gastar cómputo en renderizar la canción. El resultado final se guarda con todos sus materiales intermedios: ABC, tokens, latentes, audio y ajustes.

El paquete de inferencia se instala como un wheel de Python que se descarga del propio repositorio del modelo e incluye PyTorch, CUDA graphs y FlashAttention, con AR/NAR en BF16 y el VAE en FP32.

Edición con agentes: hablarle a la canción

La función que el equipo subraya como más novedosa es la edición agéntica. Consiste en darle a un agente la partitura, el prompt original, la letra y los cambios que uno pide en lenguaje musical corriente; el agente convierte esa petición en revisiones concretas del score, del estilo y del texto, y YuE2 renderiza cada versión nueva.

El repositorio documenta una demo de ese flujo sobre un tema titulado The Last Train: nueve pasos y catorce versiones que van del pop en mandarín al jazz en inglés, con armonía moderna y un solo de saxo construido alrededor de dos exposiciones completas de Twinkle, Twinkle, Little Star. La demo deja escuchar cada canción entera y repasar la conversación, las partituras, los prompts y las letras de cada etapa.

Para reharmonizar sin tocar nada más, la documentación aconseja pedirle al agente que conserve las alturas y el ritmo de la melodía y que revise las notas sostenidas frente a los acordes nuevos. Un aviso práctico: cot="melody" no borra por sí solo los símbolos de acorde, así que quien quiera aportar también la armonía —la original o una editada— tiene que usar cot="full".

Versiones: partir de una grabación ya existente

El flujo de covers (versiones) arranca de una grabación previa y exige dos materiales que YuE2 no produce. El primero es la partitura: el equipo propone transcribir la canción con SheetSage2 y guardar la melodía en ABC, sin símbolos de acorde. El segundo es la letra, que se puede buscar en internet con un agente o sacar del canto con Qwen3-ASR o la API de Gemini, repasando luego las palabras y ordenándolas en secciones que casen con la grabación.

Con esas dos piezas en la mano, basta con elegir el estilo de destino y llamar al pipeline con cot="melody". La documentación aconseja ejecutar las herramientas de transcripción en entornos propios, aparte del de YuE2.

En el banco de pruebas SHS100K de generación de versiones zero-shot —esto es, sin entrenamiento específico para esos temas—, las cifras que publica el equipo dan a YuE2 con partitura completa 0,647 de CLEWS mAP y un 71,3 % de Hit@1, frente al 0,419 y el 48,4 % de SongEcho. La variante sin partitura se hunde hasta 0,006 de mAP, lo que enseña hasta qué punto el condicionamiento simbólico sostiene el parecido con el original: las pruebas cubren 948 obras por dos estilos y dos semillas, 3.792 canciones por método, sin selección de candidatos.

Rendimiento: qué pide y cuánto tarda

Los requisitos declarados son Linux, Python 3.10 o superior y una GPU NVIDIA de 24 GB compatible con BF16, además de 24 GB de RAM de sistema libres. El dato más llamativo de la tabla de rendimiento es el pico de VRAM: 11,18 GiB en una RTX 4090 con planificación completa y 14,08 GiB en las pruebas de contexto máximo. Dicho de otro modo, el modelo entra con holgura en la tarjeta que recomiendan.

En esa misma RTX 4090, y según las mediciones del equipo, una canción de 3,6 minutos sale en 71,04 segundos con cot="full", a 139,48 tokens por segundo. Sin plan simbólico, el tiempo baja a 57,91 segundos. En una H800 de 80 GB la generación se queda en 54,74 segundos, con 164,38 tokens por segundo. El propio repositorio advierte de que el flujo local procesa las canciones de una en una.

Para servir el modelo a varios usuarios a la vez hay un runtime aparte, basado en vLLM 0.19 sobre H800. Con un tope de concurrencia AR de 32, las mediciones que reportan llegan a 3.231,74 tokens por segundo de sistema y 373,53 canciones por hora, frente a las 119,43 canciones por hora que da la concurrencia 1.

Los números frente a Suno, con matices

El equipo presenta resultados sobre WildSongBench, un banco de pruebas de generación de canción completa con 192 prompts. En su tabla, YuE2 en configuración best-of-8 —elige entre ocho candidatos— saca 6,9632 de media SongBench y queda por delante de Suno v5 (6,8721), Suno v5.5 (6,7150) y Mureka 9 (6,9377 en musicalidad media agregada, según esa misma tabla). La configuración estándar de YuE2, que escoge entre dos candidatos, se queda en 6,7316.

Entre los modelos abiertos evaluados la distancia crece: LeVo 2 marca 6,3247, HeartMuLa 6,2483 y ACE-Step 1.5, 6,0118. En musicalidad, YuE2 best-of-8 firma 6,2666, la cifra más alta de las dos tablas. En PER —la tasa de error de fonemas, que mide cuánto se entiende el canto— YuE2 anota un 8,44 % y su variante best-of-8 un 9,79 %, ambas por encima del 5,80 % de Suno v4.5.

Conviene recordar de dónde salen estos números: los miden y los publican los propios autores del modelo en su ficha, y no hay de por medio ninguna evaluación independiente. Además, las dos configuraciones de YuE2 de esa tabla usan planificación simbólica y el decodificador YuE2-Vae-legacy, y el informe técnico del modelo todavía no existe: el repositorio dice que llegará más adelante y, por ahora, pide citar el artículo de YuE publicado en arXiv en marzo de 2025.

Qué supone para un equipo pequeño

Unos requisitos modestos y una partitura editable cambian el tipo de trabajo que cabe hacer con un generador musical. Hasta ahora, tratar con estos sistemas era casi una lotería de prompts: si el resultado no convencía, se reescribía la descripción y a tirar el dado otra vez. Con un score intermedio a la vista, corregir deja de ser cuestión de azar y se convierte en una edición dirigida sobre elementos musicales concretos.

La barrera de verdad no es técnica, sino legal. Los pesos salen bajo CC BY-NC 4.0, que deja fuera el uso comercial, y el código de terceros que incorpora tiene sus propias licencias. Cualquier equipo que se plantee llevar YuE2-3B a producción debería leer esas condiciones antes que las tablas de benchmark.

Cuando escribimos esto, el repositorio suma 81 descargas en el último mes y dos Spaces públicos que lo ejecutan, además de dos cuantizaciones derivadas. Son cifras de un lanzamiento recién salido, no de una adopción asentada.

Conclusión

YuE2-3B defiende una tesis nítida: la música generada mejora cuando el modelo escribe antes de sonar y deja esa escritura a la vista. La partitura editable en ABC y el bucle de edición con agentes convierten la generación en un proceso que se puede repetir y corregir, y que todo eso quepa en una GPU de 24 GB lo deja al alcance de estudios pequeños y de investigadores sin clústeres. Las comparaciones con Suno v5 son autorreportadas y siguen esperando tanto el informe técnico prometido como una verificación externa; la licencia no comercial, en cambio, ya está escrita y será la que decida quién puede usarlo de verdad.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog