YuE2 вышла в открытый доступ и бросает вызов коммерческим сервисам

Команда Multimodal Art Projection выпустила музыкальный ИИ YuE2 10 сентября 2026 года. YuE2 — это открытая модель генерации музыки примерно на 3 миллиарда параметров, которую можно скачать и запустить на собственном GPU. Главное отличие от конкурентов: в отличие от большинства генераторов музыки, которые просто создают аудиоволну, YuE2 также генерирует редактируемую символическую партитуру — по сути, ноты в формате ABC notation — в середине своего пайплайна.


Как это работает

Вместо того чтобы переходить напрямую от текста к аудио, YuE2 сначала создаёт план, содержащий мелодию и аккорды в нотации ABC, а затем рендерит из него аудио. Один объединённый бэкбон AR–NAR Mixture-of-Transformers (автрегрессивный и неавторегрессивный трансформеры) записывает партитуру и семантические токены, а затем генерирует акустические латенты через flow matching.


graph LR
    A[Текст + стиль] --> B[Symbolic Plan\nМелодия + аккорды ABC]
    B --> C[Semantic Tokens]
    C --> D[Acoustic Latents\nflow matching]
    D --> E[VAE декодер]
    E --> F[48 kHz стерео аудио]

Staged Python API последовательно вызывает plan()generate_semantic()synthesize()decode(). Это позволяет вмешиваться в любой точке процесса — например, отредактировать партитуру перед финальным рендером.

💡 Быстрый старт

Для запуска нужен Linux, Python 3.12, NVIDIA GPU с поддержкой BF16 и 24 ГБ VRAM. Модель скачивается с Hugging Face автоматически при первом запуске.

git clone https://github.com/multimodal-art-projection/YuE.git
cd YuE
python3.12 -m venv .venv
source .venv/bin/activate
pip install .
python examples/generate.py --output outputs/first-song

Три режима использования

Поскольку план генерации явный, пользователь может: создавать и редактировать полную мелодию с аккордами или только мелодию; передавать свою существующую ABC-партитуру; редактировать с помощью агента — переводить музыкальный фидбек в изменения партитуры, стиля и текста, а затем рендерить новую версию.

Режим (cot)ПоведениеКогда использовать
cot="full"Генерирует план мелодии + аккордовНовые песни по умолчанию
cot="melody"Только мелодия, аккомпанемент свободныйКаверы
cot="off"Прямая генерация из текста и стиляБыстрый результат без контроля

Нулевые каверы (zero-shot covers)

Для создания кавера нужно транскрибировать исходную запись с помощью инструмента SheetSage2, получить мелодию в ABC, задать новый стиль — и YuE2 сгенерирует переосмысление. Кавер-функциональность оценивается на 948 произведениях: YuE2 достигает 0.647 CLEWS mAP против 0.006 без партитуры, без какой-либо специальной дообучки под каверы.

Агентное редактирование

Команда разработчиков демонстрирует цепочку из 14 версий одной песни, которая проходит путь от мандаринского поп-стиля до английского джаза. Пользователь общается с агентом в диалоге: просит сменить гармонию, добавить саксофон-соло, переписать строчки — и получает новую запись на каждом шаге.

ℹ Лицензирование
Код YuE2 и агент-скилл лицензированы по Apache 2.0, а веса модели — по CC BY-NC 4.0 (некоммерческое использование). Технический отчёт находится в стадии подготовки.

Бенчмарки: YuE2 против Suno

YuE2 в режиме best-of-8 достигает наивысшего среднего значения SongBench среди всех оцениваемых открытых и проприетарных моделей: 6.9632, по сравнению с 6.8721 у Suno v5, 6.5562 у Suno v6 и 6.4195 у Suno v6 Wild.

СистемаSongBench Avg ↑AudioBox PQ ↑MuLan ↑PER ↓
YuE2 (best-of-8)6.96328.27140.50519.79%
Mureka 96.93778.02260.439411.69%
Suno v56.87218.16980.54288.10%
YuE2 (стандарт)6.73168.25980.50688.44%
Suno v5.56.71508.19550.50895.96%
Suno v66.55628.12960.49167.58%
YuE 14.91657.86830.262336.38%

WildSongBench содержит 192 промпта для генерации песен: 94 на китайском и 98 на английском языке.

⚠ Важная оговорка
Все числа получены по оценке команды M-A-P на собственном бенчмарке WildSongBench. Ни одна независимая лаборатория пока не воспроизвела сравнение с Suno, а технический отчёт обозначен как «скоро». В режиме стандартной генерации (не best-of-8) YuE2 уступает Suno v5.

Технические характеристики

Модель имеет примерно 3,59 млрд параметров и 28 слоёв, поддерживает создание, кавер и редактирование. По данным команды разработчиков, на NVIDIA GeForce RTX 4090 с 24 ГБ VRAM генерация песни длиной 214,85 секунды занимает 71,04 секунды; пиковое потребление памяти — 14,08 ГБ.

YuE2-Vae декодирует акустические латенты в 48 кГц стерео аудио без квантизации. По сравнению двух декодеров: YuE2-Vae-legacy показывает более высокие оценки музыкальности в бенчмарках, а YuE2-Vae обеспечивает лучшее перцептивное качество звука.

📝 Python API: кавер за 10 строк
from pathlib import Path
from yue2 import YuE2Pipeline

with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:
    cover = pipe(
        style="English, jazz-funk, warm lead vocal, Rhodes, bass and drums",
        lyrics=Path("cover-lyrics.txt").read_text(encoding="utf-8"),
        abc=Path("cover-score/score.abc").read_text(encoding="utf-8"),
        cot="melody",
        seed=42,
    )
    cover.save_artifacts("outputs/cover")

Значение для индустрии

Символическое планирование превращает ИИ-генерацию музыки из чёрного ящика в прозрачный, управляемый процесс — как переход от автогенерации кода к IDE с дебаггером.

Вместо генерации аудио напрямую из текстового промпта YuE2 сначала создаёт редактируемую музыкальную партитуру (мелодия и аккорды в ABC-нотации), а потом рендерит из неё полную песню с вокалом и аккомпанементом. Этот двухэтапный подход даёт авторам беспрецедентный контроль над ИИ-генерацией музыки.

ComfyUI уже получил нативную поддержку YuE2 в ветке yue2 (PR #16250). Экосистема вокруг модели развивается стремительно: появляются интеграции, агент-скиллы и инструменты для транскрипции.


Итог

YuE2 — первая публично доступная модель генерации музыки, предлагающая полноценный «белый ящик»: пользователь видит и может изменить каждый элемент будущей песни до финального рендера. Редактируемая партитура — это принципиально новая возможность в открытом музыкальном ИИ, а результаты по каверам не имеют близких аналогов среди конкурентов. Пока независимые оценки ещё не проведены, но сам факт того, что открытая 3B-модель конкурирует с коммерческим Suno v5 по качеству звука, меняет расстановку сил на рынке ИИ-музыки.