Skip to content
Original
Habr · Вайбкодинг· Zazza·· 3 days agoAI score31

Yue Studio: Generating Non-Grating AI Music Locally with YuE2

Original title: Yue Studio: попытка сделать нейромузыку, от которой не мутит (по крайней мере меня)

AI overview

A developer built Yue Studio, a local AI music tool powered by the YuE2 model, aiming to avoid the “neural garbage” typical of Suno. They’ve already used it to produce the album Static and Gold. The tool supports generation by genre, vocals, and instruments, plus dramatic song structure, stem separation, overdubbing, dynamic “breathing,” and mastering. It also offers an MCP server for AI agents to call. Running it requires an NVIDIA GPU, CUDA, and 16 GB of VRAM, and the code is open source.

Full text

The full text in the selected language is awaiting translation. The original is shown for now.

5 мин

6.7K

Обзор

Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть примеры было — стало: Static and Gold.

И, да, я знаю что этих студий много, даже само вайбкод название «yue‑studio». Отличие этой — попытка сделать антинейросплоп, а не еще одну «морду» для YUE.

Скриншот программы для начала статьи
Скриншот программы для начала статьи

Зачем я это навайбкодил

Нейрослоп он сейчас везде. На работе в таск трекере задачи которые пишет ИИ и комментарии которыми отвечает ИИ. Куча картинок в интернете — ИИ (они могут быть хорошими, но кому надо хорошее). Нейромузыка, которой сейчас полно в интернете, от которой …

Знакомые часто дают послушать свои треки из Suno, и у меня от них просто горит. И не скажешь же человеку, что это говно, как‑то обидно. Да, музыка — дело субъективное, но это некачественное сгенерированное… ну вы поняли.

Недавно знакомый показал YuE2 и сказал, что она делает не хуже Suno и локально. Мне стало интересно: смогу ли я сделать что‑то, от чего у меня не будут отваливаться уши и не будет тошнить?

Первые варианты чуть не поставили крест на идее — это было отвратительно. Но мне нравится что‑то делать и пытаться.

Шаг 1. Генератор с заданным жанром, голосом и инструментами. Первым делом создал продвинутый генератор — жанр, ритм, гитары, голос, настроение — форма собирает из этого строку тегов для модели. Это уже можно было слушать, но звук был однородный и плоский, а весь трек игрался примерно в одном ритме.

Вероятно, это всё есть в Suno, но у меня даже идеи не было платить за то, что я слышал.

Шаг 2. Драматургия. Добавил форму трека: ровно, нарастание, волна и взрыв. Стало чуть лучше, но пластиковость и плоскость звука остались.

Шаг 3. Студия. Начал думать, чего мне не хватает, и добавлять: барабанную сбивку, провал, примочки на голос (и сами голоса). Так получилась «студия» для треков. В неё добавил:

  • волну громкости и спектр — видно, где что звучит;

  • разделение на дорожки. [Claude: делит не сама YuE2, а отдельная программа demucs, и дорожек всего четыре: голос, барабаны, бас и «всё остальное». Гитары и клавиши — в одной дорожке, отдельно их не вытащить. Живём с тем, что есть. (ремарка от меня)]

Шаг 4. Овердаб. Загрузил свой трек и переиграл его по‑другому. [Claude: модель играет новую партию по нотам трека в другом стиле, а приложение смешивает её с оригиналом. Настоящий овердаб поверх живой записи модель не умеет.]

Шаг 5. Дыхание и мастеринг.

  • Дыхание. Нейросеть отдаёт трек «кирпичом»: всё одинаково громко, тихих мест почти нет, от этого (отваливаются уши) слух быстро устаёт. «Дыхание» мягко опускает тихие места и не трогает громкие — у трека появляется разница между куплетом и припевом. Не совсем идеально, но разброс громкости заметно растёт.

  • Мастеринг. Последний шаг перед «релизом» трека: «дыхание» + громкость через лёгкий перегруз, немного «песка» на верхах и ограничитель пиков, чтобы ничего не хрипело.

Шаг 6. Подстановка голоса — эксперимент. Модель каждый раз поёт новым голосом (даже фиксированный seed не исправляет ситуацию). Я пробовал подставлять один голос во все треки (через Seed‑VC), чтобы не было случайного разброса. Но там свои проблемы, поэтому функция осталась с пометкой «экспериментальная»:

  • Голос дрожит, «как будто стесняется петь». Seed‑VC сделан скорее под речь, чем под пение: не помогли ни настройки, ни дообучение на голос, ни другой разделитель дорожек.

  • Портится сам трек. Сначала голос нужно вырезать из готового трека, а demucs режет неидеально: в дорожке голоса остаются куски гитар и барабанов. Они тоже проходят через замену голоса, и внутри фраз музыка начинает звучать хуже. Хотя, не исключаю, что зависит о тмузыки, для чего‑то простого может и сработает.

Шаг 7. MCP — работа через ИИ. Руками всё делать можно, но доработки трека проще делать с ИИ. Поэтому оформил MCP‑сервер: он рассказывает ИИ‑агенту, что умеет приложение, и дальше в диалоге можно просить ИИ, что нужно сделать и сразу проверять, что получилось. [Claude: MCP — протокол, через который ИИ‑агент (Claude, Codex) вызывает инструменты программы. Агент сам генерирует, слушает метрики, режет, накладывает эффекты — а решение «нравится / переделай» за тобой.]

Шаг 8. Интерфейс. С UI я тоже заморочился. Это вкусовщина, но мне нравится. За основу взял Winamp2, подтянув для 2026 года. Плюс добавил светлую тему. Winamp2 это не потому что я так стар, а потому что он четко ассоциируется у меня с музыкой.

Что получилось

В итоге я сделал альбом из того, что получилось: Static and Gold.

Музыка — субъективщина, и я делаю для себя, поэтому там мои вкусы: что‑то от Joy Division, Interpol, Jack White. В целом это ближе к современному инди, и в целом мне нравится результат. Правда, если включить настоящий живой трек, понятно, что ещё очень далеко до живого звука.

Тут не буду дублировать, но у каждого трека есть своя страница с описанием, как я его делал и внизу несколько примеров было‑стало.

Как это устроено

  • Воркер на компьютере с видеокартой NVIDIA (от 16 ГБ видеопамяти): держит модель YuE2, очередь генераций, разделение на дорожки, распознавание текста.

  • Приложение на обычном ПК (Linux/Windows/macOS): интерфейс, эффекты считаются локально (ffmpeg), с воркером общается по сети. Можно всё на одном компьютере.

  • MCP‑сервер — та же логика для ИИ‑агента.

  • Код открыт: https://github.com/Zazza/yue‑studio

Интерфейс: путь одного трека

Думаю, путеводитель по интерфейсу не нужен, сейчас у всес есть ИИ, она скажет что где и как пользоватся. Вставлю несколько скринов:

Главное окно
Главное окно
Студия трека
Студия трека

Установка

  • Что нужно: NVIDIA с CUDA и 16 ГБ видеопамяти; ~20 ГБ на диске под воркер и веса; необязательно — whisper (+3 ГБ, распознавание текста) и Seed‑VC (+11 ГБ, эксперимент с голосом).

  • Два сценария: всё на одном ПК (обычный случай) или видеокарта на отдельной машине (у меня рабочий комп без видеокарты, а с на том что с игровой видеокартой днем загружен Debian и работает для моих экспериментов c GPU).

  • Самый простой путь — попросить ИИ‑агента установить. MCP умеет install_worker с сухим прогоном (показывает план и место на диске, ничего не ставит) и doctor для проверки.

  • Руками — команды из README. Честно — не проверял.

Ограничения

  • Модель не делит трек на инструменты: только четыре дорожки demucs.

  • Поправить середину трека нельзя без пересборки: модель играет слева направо. Есть «продолжение с места» и вклейки, но на стыке бывают швы. Иногда, если получается что‑то совсем не так, проще сделать заново, тем более ABC есть ‑просто рендерим по ABC‑плану.

  • Характер голоса конкретного исполнителя не задать — только манеру. Живость голоса делается мелодией в нотах, а не словами «с надрывом» в стиле. Плюс есть экспериментальная функция в «студии». И дополнительно эффекты: рупор, перегруз, слепбек и телефон.

  • Удачная генерация — лотерея: приходится перебирать сиды. Иногда лучше делать не так: ищем основу, а дальше дополняем ее до трека. Дольше муторнее, но так и не попсу генерируем )

Итог

В общем, мне нравится, игрушка занятная, мой нераскрытый музкальный потенциал от этой игрушки в восторге. Буду писать новые альбому для себя ))

Source: Habr · Вайбкодинг · habr.com