
YuE2: открытая ИИ-модель для генерации музыки обходит Suno v5
Команда Multimodal Art Projection выпустила YuE2 — открытую модель на 3B параметров, которая генерирует полные песни с редактируемой партитурой и превосходит Suno v5 на WildSongBench.
YuE2 вышла в открытый доступ и бросает вызов коммерческим сервисам
Команда Multimodal Art Projection выпустила музыкальный ИИ YuE2 10 сентября 2026 года. YuE2 — это открытая модель генерации музыки примерно на 3 миллиарда параметров, которую можно скачать и запустить на собственном GPU. Главное отличие от конкурентов: в отличие от большинства генераторов музыки, которые просто создают аудиоволну, YuE2 также генерирует редактируемую символическую партитуру — по сути, ноты в формате ABC notation — в середине своего пайплайна.
Как это работает
Вместо того чтобы переходить напрямую от текста к аудио, YuE2 сначала создаёт план, содержащий мелодию и аккорды в нотации ABC, а затем рендерит из него аудио. Один объединённый бэкбон AR–NAR Mixture-of-Transformers (автрегрессивный и неавторегрессивный трансформеры) записывает партитуру и семантические токены, а затем генерирует акустические латенты через flow matching.
graph LR
A[Текст + стиль] --> B[Symbolic Plan\nМелодия + аккорды ABC]
B --> C[Semantic Tokens]
C --> D[Acoustic Latents\nflow matching]
D --> E[VAE декодер]
E --> F[48 kHz стерео аудио]
Staged Python API последовательно вызывает plan() → generate_semantic() → synthesize() → decode(). Это позволяет вмешиваться в любой точке процесса — например, отредактировать партитуру перед финальным рендером.
Для запуска нужен Linux, Python 3.12, NVIDIA GPU с поддержкой BF16 и 24 ГБ VRAM. Модель скачивается с Hugging Face автоматически при первом запуске.
git clone https://github.com/multimodal-art-projection/YuE.git
cd YuE
python3.12 -m venv .venv
source .venv/bin/activate
pip install .
python examples/generate.py --output outputs/first-song
Три режима использования
Поскольку план генерации явный, пользователь может: создавать и редактировать полную мелодию с аккордами или только мелодию; передавать свою существующую ABC-партитуру; редактировать с помощью агента — переводить музыкальный фидбек в изменения партитуры, стиля и текста, а затем рендерить новую версию.
Режим (cot) | Поведение | Когда использовать |
|---|---|---|
cot="full" | Генерирует план мелодии + аккордов | Новые песни по умолчанию |
cot="melody" | Только мелодия, аккомпанемент свободный | Каверы |
cot="off" | Прямая генерация из текста и стиля | Быстрый результат без контроля |
Нулевые каверы (zero-shot covers)
Для создания кавера нужно транскрибировать исходную запись с помощью инструмента SheetSage2, получить мелодию в ABC, задать новый стиль — и YuE2 сгенерирует переосмысление. Кавер-функциональность оценивается на 948 произведениях: YuE2 достигает 0.647 CLEWS mAP против 0.006 без партитуры, без какой-либо специальной дообучки под каверы.
Агентное редактирование
Команда разработчиков демонстрирует цепочку из 14 версий одной песни, которая проходит путь от мандаринского поп-стиля до английского джаза. Пользователь общается с агентом в диалоге: просит сменить гармонию, добавить саксофон-соло, переписать строчки — и получает новую запись на каждом шаге.
Бенчмарки: YuE2 против Suno
YuE2 в режиме best-of-8 достигает наивысшего среднего значения SongBench среди всех оцениваемых открытых и проприетарных моделей: 6.9632, по сравнению с 6.8721 у Suno v5, 6.5562 у Suno v6 и 6.4195 у Suno v6 Wild.
| Система | SongBench Avg ↑ | AudioBox PQ ↑ | MuLan ↑ | PER ↓ |
|---|---|---|---|---|
| YuE2 (best-of-8) | 6.9632 | 8.2714 | 0.5051 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 0.4394 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 0.5428 | 8.10% |
| YuE2 (стандарт) | 6.7316 | 8.2598 | 0.5068 | 8.44% |
| Suno v5.5 | 6.7150 | 8.1955 | 0.5089 | 5.96% |
| Suno v6 | 6.5562 | 8.1296 | 0.4916 | 7.58% |
| YuE 1 | 4.9165 | 7.8683 | 0.2623 | 36.38% |
WildSongBench содержит 192 промпта для генерации песен: 94 на китайском и 98 на английском языке.
Технические характеристики
Модель имеет примерно 3,59 млрд параметров и 28 слоёв, поддерживает создание, кавер и редактирование. По данным команды разработчиков, на NVIDIA GeForce RTX 4090 с 24 ГБ VRAM генерация песни длиной 214,85 секунды занимает 71,04 секунды; пиковое потребление памяти — 14,08 ГБ.
YuE2-Vae декодирует акустические латенты в 48 кГц стерео аудио без квантизации. По сравнению двух декодеров: YuE2-Vae-legacy показывает более высокие оценки музыкальности в бенчмарках, а YuE2-Vae обеспечивает лучшее перцептивное качество звука.
from pathlib import Path
from yue2 import YuE2Pipeline
with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:
cover = pipe(
style="English, jazz-funk, warm lead vocal, Rhodes, bass and drums",
lyrics=Path("cover-lyrics.txt").read_text(encoding="utf-8"),
abc=Path("cover-score/score.abc").read_text(encoding="utf-8"),
cot="melody",
seed=42,
)
cover.save_artifacts("outputs/cover")
Значение для индустрии
Символическое планирование превращает ИИ-генерацию музыки из чёрного ящика в прозрачный, управляемый процесс — как переход от автогенерации кода к IDE с дебаггером.
Вместо генерации аудио напрямую из текстового промпта YuE2 сначала создаёт редактируемую музыкальную партитуру (мелодия и аккорды в ABC-нотации), а потом рендерит из неё полную песню с вокалом и аккомпанементом. Этот двухэтапный подход даёт авторам беспрецедентный контроль над ИИ-генерацией музыки.
ComfyUI уже получил нативную поддержку YuE2 в ветке yue2 (PR #16250). Экосистема вокруг модели развивается стремительно: появляются интеграции, агент-скиллы и инструменты для транскрипции.
Итог
YuE2 — первая публично доступная модель генерации музыки, предлагающая полноценный «белый ящик»: пользователь видит и может изменить каждый элемент будущей песни до финального рендера. Редактируемая партитура — это принципиально новая возможность в открытом музыкальном ИИ, а результаты по каверам не имеют близких аналогов среди конкурентов. Пока независимые оценки ещё не проведены, но сам факт того, что открытая 3B-модель конкурирует с коммерческим Suno v5 по качеству звука, меняет расстановку сил на рынке ИИ-музыки.