Step by Step:動手生成第一首歌
以下以目前最容易處理的 Windows + NVIDIA GPU + ComfyUI Portable 作示範。由於 YuE2 已加入 ComfyUI 原生模型支援,現階段一般使用者已毋須額外安裝早期的第三方 YuE2 custom node。ComfyUI 官方亦已把 Yue 2 列入原生音訊生成支援模型。

Step 1:準備硬件
建議使用:
- Windows 11
- NVIDIA RTX 顯示卡
- 建議 24GB VRAM,實測 16GM VRAM 亦可。
- 至少預留數十 GB SSD 空間
- 最新 NVIDIA Driver
RTX 3090、4090 等 24GB 顯示卡是比較穩妥的本地生成起點,但實測用 16GB VRAM 亦可。如果 VRAM 較少,仍可能透過 INT8、offload 或縮短作品長度運行,但生成速度和可用長度需要實際視乎工作流程。
Step 2:下載及安裝 ComfyUI
到 ComfyUI 官方 GitHub 下載 Windows Portable 版本,解壓至任意目錄,如 ComfyUI_windows_portable。執行當中的 run_nvidia_gpu.bat,成功後瀏覽器正常會會開啟 ComfyUI 介面。
Windows Portable 已包括所需 Python 環境,因此普通使用者毋須另外自行配置 Python。
Step 3:先把 ComfyUI 更新至最新版
YuE2 是 2026 年 9 月才加入的新模型,如果使用舊版 ComfyUI,很可能找不到相應 Node。
透過 ComfyUI 的更新功能更新至最新版本;如果使用 portable 的更新工具,也應先完成更新再重新啟動。
Step 4:從官方 YuE2 Workflow 下載官方 INT8 YuE2 模型
更新後,在 ComfyUI Workflow Templates 找尋 YuE2 Text to Music,這是入門最簡單的 Workflow,修改 Prompt 就可以嘗試生成歌曲。這 workflow 使用 yue2_3b_int8_convrot.safetensors,選用 YuE2 Text-to-Music workflow 後畫面右邊會顯示找不到模型的提示,只要點擊 View Detail 就會看到下載連結,檔案有 3.7GB。把下載完成的 .safetensors 檔案放到 ComfyUI\models\checkpoints\ 重載 ComfyUI 就可以。

最後目錄應類似:
ComfyUI
└─ models
└─ checkpoints
└─ yue2_3b_int8_convrot.safetensorsStep 5:官方 YuE2 Workflow
官方 YuE2 Text to Music template 已包含所需工作流程,包括:
CheckpointLoaderSimple
↓
YuE2GenerateABC
↓
YuE2GenerateMusic
↓
YuE2 audio latent / sampler
↓
VAE decode
↓
Save Audio

Step 6:輸入 Style
YuE2 把「音樂要求」和「真正演唱的歌詞」分成兩個欄位。
例如 Style 可以輸入:
Japanese city pop, female vocal, 105 BPM,
electric piano, clean electric guitar,
warm analog synthesizer, melodic bass,
bright 1980s arrangement比較理想的格式是:
語言 + 曲風 + 聲線 + BPM + 樂器 + 編曲特徵不要把「Verse 要用甚麼樂器」之類的製作指令混在歌詞中。
Step 7:輸入歌詞
Lyrics 欄只放真正要唱出的文字,並利用段落標籤告訴模型歌曲結構,例如:
[Verse]
夜の街を歩いて
遠く光る街灯
[Chorus]
もう一度 君に会いたい
星空の下でYuE2 支援結構如:
[Verse]
[Chorus]
[Bridge]
[Outro]ComfyUI 官方 workflow 亦建議把音樂描述放在 Style,而 Lyrics 只保留真正演唱的文字。
Step 8:開啟 ABC Planning
這是 YuE2 最值得試的功能。
選擇 Full 時,YuE2 會先生成旋律 + 和弦的 ABC 符號樂譜,再根據這份樂譜製作音訊。如果選擇 Melody,則只先規劃旋律,讓伴奏部分有較大自由度。
亦可以關閉 ABC Planning,讓 YuE2 跳過符號規劃直接生成歌曲。官方 workflow 建議普通 Text-to-Music 使用 Full 模式。

Step 9:先用短歌曲測試
第一次不要立即生成 4 至 5 分鐘完整歌曲。
可以先把 Max Duration 設為 30–60 秒,確認模型可以正常載入及 VRAM 足夠,再逐步增加長度。
YuE2 官方資料指出,長音訊仍然是最消耗 GPU 記憶體的部分,因此這亦是避免首次運行便觸發 OOM 的比較安全做法。
Step 10:按 Run 開始作曲
按下 Run / Queue Prompt 後,YuE2 會大致完成:
Style + Lyrics
↓
ABC 樂譜規劃
↓
語義生成
↓
聲學 Latent
↓
VAE Decode
↓
48kHz Stereo Audio完成後歌曲可直接在 ComfyUI 預覽,而官方 template 預設以 FLAC 保存至 ComfyUI\output\audio\ 目錄。YuE2 官方原生 Pipeline 同樣以 48kHz stereo 作為預設輸出格式。
筆者測試以 RTX 4060Ti (16GB VRAM),只花了 49 秒就生成了 90 秒歌曲,而且質素相當高。
生成歌曲試聽
真正值得留意的是「可以改譜」
單純比較生成歌曲的方便程度,Suno v6 對一般人仍明顯較簡單;它已經是一個完整音樂製作服務,而 YuE2 本地部署仍要求一定 AI 軟件及 GPU 知識。
但 YuE2 帶來的另一種可能性,是 AI 作曲不再只有「Prompt → WAV」這個過程。
由於模型把歌曲的符號結構獨立出來,創作者未來可以把 ABC 樂譜接駁樂譜編輯器、DAW、MIDI、其他 Agent,甚至自己編寫自動化工作流程。這種架構亦較容易追蹤「AI 究竟改了哪一個音符」,而不是每修改一次 Prompt 就重新生成一個不可預測的新版本。

HKGAI 亦同步開放包括轉譜工具、音樂理解模型和評測基準等工具,嘗試建立由「轉譜—創作—編輯—評測」組成的完整開源工具鏈。
不過目前 YuE2 模型權重的免費授權只限非商業用途;需要用於商業製作的創作者仍需另外取得授權。
因此,YuE2 是否真的會成為 HKGAI 所形容的音樂界「DeepSeek 時刻」,還需要更多獨立的人類聆聽測試、實際製作案例和社群工具支持才能判斷。但至少從目前公開 benchmark、開源模型、本地部署以及 ComfyUI 原生支援來看,它已經不是單純用來展示技術的研究模型,而開始具備成為實際 AI 音樂製作工具的條件。



