Codi obert
YuE2-3B genera i edita música amb agents en una sola GPU de 24 GB
L'equip de Multimodal Art Projection (m-a-p) ha publicat a Hugging Face YuE2-3B, un model obert que converteix una lletra i una descripció d'estil en una cançó sencera, amb veu i acompanyament, i que a més ensenya una partitura editable per retocar la melodia i l'harmonia. Segons la documentació dels seus autors, funciona en local amb una GPU NVIDIA de 24 GB sense quantització i produeix àudio estèreo a 48 kHz. Els pesos surten amb llicència CC BY-NC 4.0, és a dir, sense ús comercial.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- YuE2-3B és un model obert de text a música que m-a-p ha publicat a Hugging Face, amb 4.000 milions de paràmetres en format BF16 i llicència CC BY-NC 4.0 (no comercial).
- Compon cançons senceres amb veu i acompanyament a partir d'una lletra i un prompt d'estil, i lliura una partitura en format ABC que l'usuari pot modificar.
- Demana Linux, Python 3.10 o superior i una GPU NVIDIA de 24 GB compatible amb BF16; la fitxa declara un pic d'11,18 GiB de VRAM en una RTX 4090.
- L'equip mesura 71 segons per generar una cançó de 3,6 minuts en una RTX 4090 amb planificació completa.
- Al banc de proves WildSongBench, les xifres que publiquen els autors donen a YuE2 (best-of-8) una mitjana de 6,9632 davant del 6,8721 de Suno v5; són dades autoreportades, no una avaluació independent.
- Incorpora un flux d'edició amb agents: un agent tradueix els comentaris musicals en canvis de partitura, estil i lletra, i el model torna a renderitzar cada versió.
Què és YuE2-3B i en què s'aparta de la resta
YuE2-3B és el nou lliurament de la família YuE, que desenvolupa Multimodal Art Projection (m-a-p), i arriba a Hugging Face com a model obert de text-to-audio (text a àudio). El plantejament de partida sona conegut: li dones una lletra i un prompt d'estil —una descripció escrita del so que busques— i el model et torna una cançó sencera, amb línia vocal i acompanyament instrumental.
El que el distingeix de la majoria de generadors musicals passa pel camí. YuE2 no salta del text a l'àudio d'una estrebada: primer escriu un pla simbòlic, una partitura amb melodia i acords que l'usuari pot llegir, revisar i canviar abans o després de sintetitzar el so. Aquest pla apareix en notació ABC, un format de text pla per escriure música, de manera que editar-lo costa el mateix que obrir un fitxer.
Un sol paràmetre decideix com planifica. Amb cot="full" el model traça melodia i acords, que és l'opció per defecte; amb cot="melody" es limita a la melodia, la via que els seus autors recomanen per fer versions; i amb cot="off" genera de manera directa, sense pla simbòlic pel mig.
Una arquitectura que escriu abans de sonar
La descripció tècnica de la fitxa explica que el sistema es basa en un únic backbone de tipus Mixture-of-Transformers, amb components AR i NAR —autoregressiu i no autoregressiu—, que escriu tant la partitura com els tokens semàntics. Després, un procés de flow matching genera els latents acústics i un VAE els tradueix en àudio estèreo.
Separar la planificació de la síntesi no és només una decisió de disseny intern: l'usuari la veu com dues APIs diferents. El mètode pipe.plan() retorna el pla simbòlic sense generar encara l'àudio, de manera que es pot inspeccionar i corregir l'estructura musical abans de gastar càlcul a renderitzar la cançó. El resultat final es desa amb tots els seus materials intermedis: ABC, tokens, latents, àudio i ajustos.
El paquet d'inferència s'instal·la com un wheel de Python que es descarrega del mateix repositori del model i inclou PyTorch, CUDA graphs i FlashAttention, amb AR/NAR en BF16 i el VAE en FP32.
Edició amb agents: parlar-li a la cançó
La funció que l'equip subratlla com la més nova és l'edició agèntica. Consisteix a donar a un agent la partitura, el prompt original, la lletra i els canvis que demanes en llenguatge musical corrent; l'agent converteix aquesta petició en revisions concretes de la partitura, de l'estil i del text, i YuE2 renderitza cada versió nova.
El repositori documenta una demo d'aquest flux sobre un tema titulat The Last Train: nou passos i catorze versions que van del pop en mandarí al jazz en anglès, amb harmonia moderna i un solo de saxo construït al voltant de dues exposicions completes de Twinkle, Twinkle, Little Star. La demo deixa escoltar cada cançó sencera i repassar la conversa, les partitures, els prompts i les lletres de cada etapa.
Per reharmonitzar sense tocar res més, la documentació recomana demanar a l'agent que conservi les altures i el ritme de la melodia i que revisi les notes sostingudes davant dels acords nous. Un avís pràctic: cot="melody" no esborra per si sol els símbols d'acord, així que qui també vulgui aportar l'harmonia —l'original o una d'editada— ha de fer servir cot="full".
Versions: partir d'un enregistrament que ja existeix
El flux de covers (versions) arrenca d'un enregistrament previ i exigeix dos materials que YuE2 no produeix. El primer és la partitura: l'equip proposa transcriure la cançó amb SheetSage2 i desar la melodia en ABC, sense símbols d'acord. El segon és la lletra, que es pot buscar a internet amb un agent o treure del cant amb Qwen3-ASR o l'API de Gemini, repassant després les paraules i ordenant-les en seccions que quadrin amb l'enregistrament.
Amb aquestes dues peces a la mà, només cal triar l'estil de destinació i cridar el pipeline amb cot="melody". La documentació recomana executar les eines de transcripció en entorns propis, a part del de YuE2.
Al banc de proves SHS100K de generació de versions zero-shot —és a dir, sense entrenament específic per a aquests temes—, les xifres que publica l'equip donen a YuE2 amb partitura completa 0,647 de CLEWS mAP i un 71,3 % de Hit@1, davant del 0,419 i el 48,4 % de SongEcho. La variant sense partitura s'enfonsa fins a 0,006 de mAP, cosa que ensenya fins a quin punt el condicionament simbòlic sosté la semblança amb l'original: les proves cobreixen 948 obres per dos estils i dues llavors, 3.792 cançons per mètode, sense selecció de candidats.
Rendiment: què demana i quant tarda
Els requisits declarats són Linux, Python 3.10 o superior i una GPU NVIDIA de 24 GB compatible amb BF16, a més de 24 GB de RAM de sistema lliures. La dada més cridanera de la taula de rendiment és el pic de VRAM: 11,18 GiB en una RTX 4090 amb planificació completa i 14,08 GiB a les proves de context màxim. Dit d'una altra manera, el model entra amb escreix a la targeta que recomanen.
En aquesta mateixa RTX 4090, i segons els mesuraments de l'equip, una cançó de 3,6 minuts surt en 71,04 segons amb cot="full", a 139,48 tokens per segon. Sense pla simbòlic, el temps baixa a 57,91 segons. En una H800 de 80 GB la generació es queda en 54,74 segons, amb 164,38 tokens per segon. El mateix repositori avisa que el flux local processa les cançons d'una en una.
Per servir el model a diversos usuaris alhora hi ha un runtime a part, basat en vLLM 0.19 sobre H800. Amb un topall de concurrència AR de 32, els mesuraments que reporten arriben a 3.231,74 tokens per segon de sistema i 373,53 cançons per hora, davant de les 119,43 cançons per hora que dona la concurrència 1.
Els números davant de Suno, amb matisos
L'equip presenta resultats sobre WildSongBench, un banc de proves de generació de cançó completa amb 192 prompts. A la seva taula, YuE2 en configuració best-of-8 —tria entre vuit candidats— treu 6,9632 de mitjana SongBench i queda per davant de Suno v5 (6,8721), Suno v5.5 (6,7150) i Mureka 9 (6,9377 en musicalitat mitjana agregada, segons aquesta mateixa taula). La configuració estàndard de YuE2, que escull entre dos candidats, es queda en 6,7316.
Entre els models oberts avaluats la distància creix: LeVo 2 marca 6,3247, HeartMuLa 6,2483 i ACE-Step 1.5, 6,0118. En musicalitat, YuE2 best-of-8 signa 6,2666, la xifra més alta de les dues taules. En PER —la taxa d'error de fonemes, que mesura quant s'entén el cant— YuE2 anota un 8,44 % i la seva variant best-of-8 un 9,79 %, totes dues per sobre del 5,80 % de Suno v4.5.
Val la pena recordar d'on surten aquests números: els mesuren i els publiquen els mateixos autors del model a la seva fitxa, i no hi ha pel mig cap avaluació independent. A més, les dues configuracions de YuE2 d'aquesta taula fan servir planificació simbòlica i el descodificador YuE2-Vae-legacy, i l'informe tècnic del model encara no existeix: el repositori diu que arribarà més endavant i, ara com ara, demana citar l'article de YuE publicat a arXiv el març del 2025.
Què suposa per a un equip petit
Uns requisits modestos i una partitura editable canvien el tipus de feina que es pot fer amb un generador musical. Fins ara, tractar amb aquests sistemes era gairebé una loteria de prompts: si el resultat no convencia, es reescrivia la descripció i a tirar el dau un altre cop. Amb un score intermedi a la vista, corregir deixa de ser qüestió d'atzar i passa a ser una edició dirigida sobre elements musicals concrets.
La barrera de debò no és tècnica, sinó legal. Els pesos surten sota CC BY-NC 4.0, que deixa fora l'ús comercial, i el codi de tercers que incorpora té les seves pròpies llicències. Qualsevol equip que es plantegi portar YuE2-3B a producció hauria de llegir aquestes condicions abans que les taules de benchmark.
Quan escrivim això, el repositori suma 81 descàrregues l'últim mes i dos Spaces públics que l'executen, a més de dues quantitzacions derivades. Són xifres d'un llançament acabat de sortir, no d'una adopció assentada.
Conclusió
YuE2-3B defensa una tesi nítida: la música generada millora quan el model escriu abans de sonar i deixa aquesta escriptura a la vista. La partitura editable en ABC i el bucle d'edició amb agents converteixen la generació en un procés que es pot repetir i corregir, i que tot això càpiga en una GPU de 24 GB el deixa a l'abast d'estudis petits i d'investigadors sense clústers. Les comparacions amb Suno v5 són autoreportades i continuen esperant tant l'informe tècnic promès com una verificació externa; la llicència no comercial, en canvi, ja està escrita i serà la que decidirà qui el pot fer servir de debò.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios