HKGAI 推出開源音樂模型 YuE2 實測指標挑戰 Suno v6 教你用 ComfyUI 作曲

Author:

Published:

- 廣告 -

Step by Step:動手生成第一首歌

以下以目前最容易處理的 Windows + NVIDIA GPU + ComfyUI Portable 作示範。由於 YuE2 已加入 ComfyUI 原生模型支援,現階段一般使用者已毋須額外安裝早期的第三方 YuE2 custom node。ComfyUI 官方亦已把 Yue 2 列入原生音訊生成支援模型。

YuE2 已加入 ComfyUI 原生模型支援,可以在 Template 裡找到官方 Workflow。
YuE2 已加入 ComfyUI 原生模型支援,可以在 Template 裡找到官方 Workflow。

Step 1:準備硬件

建議使用:

  • Windows 11
  • NVIDIA RTX 顯示卡
  • 建議 24GB VRAM,實測 16GM VRAM 亦可。
  • 至少預留數十 GB SSD 空間
  • 最新 NVIDIA Driver

RTX 3090、4090 等 24GB 顯示卡是比較穩妥的本地生成起點,但實測用 16GB VRAM 亦可。如果 VRAM 較少,仍可能透過 INT8、offload 或縮短作品長度運行,但生成速度和可用長度需要實際視乎工作流程。

- 廣告 -

Step 2:下載及安裝 ComfyUI

到 ComfyUI 官方 GitHub 下載 Windows Portable 版本,解壓至任意目錄,如 ComfyUI_windows_portable。執行當中的 run_nvidia_gpu.bat,成功後瀏覽器正常會會開啟 ComfyUI 介面。

Windows Portable 已包括所需 Python 環境,因此普通使用者毋須另外自行配置 Python。

Step 3:先把 ComfyUI 更新至最新版

YuE2 是 2026 年 9 月才加入的新模型,如果使用舊版 ComfyUI,很可能找不到相應 Node。

透過 ComfyUI 的更新功能更新至最新版本;如果使用 portable 的更新工具,也應先完成更新再重新啟動。

Step 4:從官方 YuE2 Workflow 下載官方 INT8 YuE2 模型

更新後,在 ComfyUI Workflow Templates 找尋 YuE2 Text to Music,這是入門最簡單的 Workflow,修改 Prompt 就可以嘗試生成歌曲。這 workflow 使用 yue2_3b_int8_convrot.safetensors,選用 YuE2 Text-to-Music workflow 後畫面右邊會顯示找不到模型的提示,只要點擊 View Detail 就會看到下載連結,檔案有 3.7GB。把下載完成的 .safetensors 檔案放到 ComfyUI\models\checkpoints\ 重載 ComfyUI 就可以。

首次載入官方 Workflow 後會提示找不到模型,右邊欄會提供下載按鈕。
首次載入官方 Workflow 後會提示找不到模型,右邊欄會提供下載按鈕。

最後目錄應類似:

- 廣告 -
ComfyUI
└─ models
   └─ checkpoints
      └─ yue2_3b_int8_convrot.safetensors

Step 5:官方 YuE2 Workflow

官方 YuE2 Text to Music template 已包含所需工作流程,包括:

CheckpointLoaderSimple
        ↓
YuE2GenerateABC
        ↓
YuE2GenerateMusic
        ↓
YuE2 audio latent / sampler
        ↓
VAE decode
        ↓
Save Audio
表面看來 Text to Music (YuE2) 的 workflow 相當簡單,簡單創作的話這就夠了。
表面看來 Text to Music (YuE2) 的 workflow 相當簡單,簡單創作的話這就夠了。
點進 Text to Music (YuE2) node 標題右邊的 Subgraph node 圖示,就會看到真正的複雜 workflow。
點進 Text to Music (YuE2) node 標題右邊的 Subgraph node 圖示,就會看到真正的複雜 workflow。

Step 6:輸入 Style

YuE2 把「音樂要求」和「真正演唱的歌詞」分成兩個欄位。

例如 Style 可以輸入:

Japanese city pop, female vocal, 105 BPM,
electric piano, clean electric guitar,
warm analog synthesizer, melodic bass,
bright 1980s arrangement

比較理想的格式是:

語言 + 曲風 + 聲線 + BPM + 樂器 + 編曲特徵

不要把「Verse 要用甚麼樂器」之類的製作指令混在歌詞中。

Step 7:輸入歌詞

Lyrics 欄只放真正要唱出的文字,並利用段落標籤告訴模型歌曲結構,例如:

[Verse]
夜の街を歩いて
遠く光る街灯

[Chorus]
もう一度 君に会いたい
星空の下で

YuE2 支援結構如:

[Verse]
[Chorus]
[Bridge]
[Outro]

ComfyUI 官方 workflow 亦建議把音樂描述放在 Style,而 Lyrics 只保留真正演唱的文字。

Step 8:開啟 ABC Planning

這是 YuE2 最值得試的功能。

選擇 Full 時,YuE2 會先生成旋律 + 和弦的 ABC 符號樂譜,再根據這份樂譜製作音訊。如果選擇 Melody,則只先規劃旋律,讓伴奏部分有較大自由度。

亦可以關閉 ABC Planning,讓 YuE2 跳過符號規劃直接生成歌曲。官方 workflow 建議普通 Text-to-Music 使用 Full 模式。

可以在 Subgraph 的 ABC planning 一節修改樂譜。
可以在 Subgraph 的 ABC planning 一節修改樂譜。

Step 9:先用短歌曲測試

第一次不要立即生成 4 至 5 分鐘完整歌曲。

可以先把 Max Duration 設為 30–60 秒,確認模型可以正常載入及 VRAM 足夠,再逐步增加長度。

YuE2 官方資料指出,長音訊仍然是最消耗 GPU 記憶體的部分,因此這亦是避免首次運行便觸發 OOM 的比較安全做法。

Step 10:按 Run 開始作曲

按下 Run / Queue Prompt 後,YuE2 會大致完成:

Style + Lyrics
        ↓
ABC 樂譜規劃
        ↓
語義生成
        ↓
聲學 Latent
        ↓
VAE Decode
        ↓
48kHz Stereo Audio

完成後歌曲可直接在 ComfyUI 預覽,而官方 template 預設以 FLAC 保存至 ComfyUI\output\audio\ 目錄。YuE2 官方原生 Pipeline 同樣以 48kHz stereo 作為預設輸出格式。

筆者測試以 RTX 4060Ti (16GB VRAM),只花了 49 秒就生成了 90 秒歌曲,而且質素相當高。

生成歌曲試聽

示範 1:以上述 prompt 和歌詞來生成的歌曲。
示範 2。Prompt: mid-tempo acoustic ballad, somber melancholic atmosphere, gentle acoustic guitar and soft piano with restrained strings, female vocalist only, 14-year-old girl voice, cute light sweet high-pitched youthful voice with soft vulnerable and melancholic tone like teenage girl in quiet pain, initial somber loneliness in verse, gradual building bass line in pre-chorus symbolizing discovering love, passionate emotional climax in chorus for guardian oath, emotional feminine sensitivity with bittersweet longing, no upbeat cheer, no light-hearted folk feel, no electronic synths, no heavy drums, natural organic instrumentation, BPM 110-120, full lyrics sung completely, Aimer-inspired melancholic depth with restrained passion

真正值得留意的是「可以改譜」

單純比較生成歌曲的方便程度,Suno v6 對一般人仍明顯較簡單;它已經是一個完整音樂製作服務,而 YuE2 本地部署仍要求一定 AI 軟件及 GPU 知識。

但 YuE2 帶來的另一種可能性,是 AI 作曲不再只有「Prompt → WAV」這個過程。

由於模型把歌曲的符號結構獨立出來,創作者未來可以把 ABC 樂譜接駁樂譜編輯器、DAW、MIDI、其他 Agent,甚至自己編寫自動化工作流程。這種架構亦較容易追蹤「AI 究竟改了哪一個音符」,而不是每修改一次 Prompt 就重新生成一個不可預測的新版本。

可修改樂譜可說是 YuE2 最值得注意的功能。
可修改樂譜可說是 YuE2 最值得注意的功能。

HKGAI 亦同步開放包括轉譜工具、音樂理解模型和評測基準等工具,嘗試建立由「轉譜—創作—編輯—評測」組成的完整開源工具鏈。

不過目前 YuE2 模型權重的免費授權只限非商業用途;需要用於商業製作的創作者仍需另外取得授權。

因此,YuE2 是否真的會成為 HKGAI 所形容的音樂界「DeepSeek 時刻」,還需要更多獨立的人類聆聽測試、實際製作案例和社群工具支持才能判斷。但至少從目前公開 benchmark、開源模型、本地部署以及 ComfyUI 原生支援來看,它已經不是單純用來展示技術的研究模型,而開始具備成為實際 AI 音樂製作工具的條件。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
Mickey Chan
Mickey Chan
愛模擬飛行、希望終有一日回到單車上的宅,眼鏡娘控。座右銘: 1.膽固醇跟美味是成正比的; 2.所有人都可以騙,但絕對不能騙自己; 3.賣掉的貨才是錢,不賣的收藏品不值一文; 4.踩單車,是為了吃更多美食! 5.正義的話語,不一定出自正義之人的口;
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -