どうも、管理人です。
以前、Windowsで音楽生成AI「ACE-Step 1.5」の専用Portable版を導入しました。
実際に使えるようになるまでにはモデル設定や起動オプションなどでいくつか詰まるところがあり、このブログでもその時の手順を記事にしています。
Windowsで音楽生成モデル「ACE-Step-Portable」(1.5)を動かす
その後、ACE-Step 1.5をComfyUIでも使ってみたのですが、こちらは思っていた以上に簡単でした。
現在のComfyUIにはACE-Step 1.5用のワークフローテンプレートが用意されており、初心者向けには必要なモデルを1ファイルにまとめたAIO(All-in-One)版もあります。
ComfyUI自体について知りたい方へ:
ComfyUIはACE-Stepの音楽生成だけでなく、画像・動画・音声・3Dなど、さまざまな生成AIを同じ環境で扱えるツールです。ComfyUIがどんなものなのか、Workflowやテンプレートの仕組み、Desktop版とPortable版の違いについてはこちらの記事でまとめています。
画像・動画・音楽を生成できるComfyUIとは?WindowsローカルAIを初心者向けに解説
ただ、初めてComfyUIを触ったときには、
- そもそもComfyUIをどこから入手するのか
- ダウンロードしたComfyUIをどうやって起動するのか
- テンプレートはどこにあるのか
- ACE-Step 1.5だけでも複数あるけど、どれを選べばいいのか
- 曲調やジャンルは画面のどこへ入力するのか
- 歌詞はどこへ入力するのか
- モデルはどこからダウンロードするのか
- 生成した音楽はどこに保存されたのか
といったところで少し迷いました。
この記事では、ComfyUIをまだ入れていない状態からACE-Step 1.5で最初の1曲を生成するまでを、実際にWindows PCで確認した内容をもとに順番に紹介します。
- ACE-Step 1.5をComfyUIで使うための環境の目安
- 今回の検証環境
- ComfyUI Portableをダウンロードして起動する
- ACE-Step 1.5のテンプレートを開く
- 初心者なら「ACE-Step 1.5 音楽生成 AIO」がおすすめ
- モデルが入っていなくてもComfyUIが教えてくれる
- AIOモデルをダウンロードして配置する
- モデルを置いたのに警告が消えない場合
- 曲のプロンプトと歌詞は画面のどこに入力する?
- 実際にACE-Step 1.5で音楽を生成する
- RTX 5070 Ti 16GBで30秒曲を生成した結果
- 生成した音楽はどこに保存される?
- 私はモデルをSSD、生成ファイルをHDDに分けている
- AIO版と分割モデル版はどちらを使えばいい?
- 専用ACE-Step Portable版と比べてどうだった?
- まとめ
ACE-Step 1.5をComfyUIで使うための環境の目安
最初にPC環境についてです。
ACE-Step 1.5自体は比較的VRAMが少ないGPUでも動作できるよう設計されていますが、VRAM容量によって使用できるモデルやLM(言語モデル)、CPUオフロードの必要性などが変わります。
ACE-Step 1.5公式のGPU別推奨構成を大まかに整理すると、次のようなイメージです。
- 6GB以下:2B turbo中心、LMなしの軽量構成
- 6~8GB:2B turbo + 軽量な0.6B LM
- 8~16GB:2B turbo / sft + 0.6Bまたは1.7B LM
- 16GB以上:2B系に加えてXL系も選択肢に入る
そのため、これからComfyUIでACE-Step 1.5を普通に試してみたい場合は、個人的にはVRAM 8GB以上を一つの分かりやすい目安にするとよいと思います。
もちろん8GB未満では動かないという意味ではありません。使用するモデルや設定、CPUオフロードなどによって必要なVRAMは変わります。
また、今回使用するAIOモデルだけでも約9GB以上あるため、ストレージにも十分な空き容量を用意しておいてください。
詳しいGPU別構成については、ACE-Step 1.5公式GitHubも確認してみてください。
今回の検証環境
今回実際に確認した環境は次のとおりです。
- Windows PC
- NVIDIA GeForce RTX 5070 Ti 16GB
- NVIDIA Driver 610.62
- ComfyUI v0.28.0
ACE-Step 1.5については、初心者向けのAIO版と、複数のモデルファイルを個別に読み込む分割版の両方で生成を確認しました。
この記事では、まずAIO版を使って最初の1曲を作る方法を中心に説明します。
ComfyUI Portableをダウンロードして起動する
ComfyUIをまだ入れていない場合は、まずWindows Portable版を用意します。
ComfyUI Portableは、ComfyUI本体と実行に必要な独立したPython環境がセットになったWindows向けパッケージです。
Python環境を別途用意して一から構築する必要がなく、基本的にはダウンロード → 解凍 → 起動という流れで使い始められます。
1. ComfyUI公式ページを開く
まず、ComfyUI公式のWindows Portable版ページを開きます。
ページ内の「ComfyUI Portableのダウンロード」から、自分が使っているGPUに合ったPortable版を選びます。
NVIDIA GeForce RTXシリーズを使っている場合は、NVIDIA GPU向けの標準Portable版を選べばよいでしょう。
ComfyUI公式ページではNVIDIAだけでなく、AMD GPUやIntel GPU向けのPortable版も案内されています。
ダウンロード項目やCUDA・Pythonのバージョンは今後更新される可能性があるため、その時点で公式ページに案内されている自分のGPU向けパッケージを選ぶのがおすすめです。
2. ダウンロードしたファイルを解凍する
ダウンロードが終わったら、圧縮ファイルを解凍します。
ComfyUI公式では7-Zipを使った解凍が案内されています。
解凍すると、次のようなComfyUI_windows_portableフォルダができます。
ComfyUI_windows_portable
├─ ComfyUI
├─ python_embeded
├─ update
├─ README_VERY_IMPORTANT.txt
├─ run_cpu.bat
└─ run_nvidia_gpu.bat
このフォルダ一式がComfyUIの実行環境になります。
3. ComfyUIフォルダを使いたい場所へ配置する
解凍したComfyUI_windows_portableフォルダは、自分が管理しやすい場所へ移動して構いません。
私の環境ではSSDのDドライブに、
D:\ComfyUI_windows_portable
として配置しています。
このあとACE-Stepだけでなく、画像生成・動画生成などのAIモデルも同じComfyUI環境へ追加していくことになるため、空き容量に余裕のあるドライブへ置いておくと管理しやすいです。
特にAIモデルは1ファイルで数GB~十数GBになることもあります。
4. run_nvidia_gpu.batからComfyUIを起動する
NVIDIA GPUを使用している場合は、ComfyUI_windows_portableフォルダ内にある、
run_nvidia_gpu.bat
をダブルクリックします。
起動すると黒いコマンドプロンプト画面が開き、ComfyUIの読み込みが始まります。
ブラウザが自動で開かない場合は、ChromeやEdgeなどで次のアドレスを開いてください。
http://127.0.0.1:8188
ComfyUIを使用している間は、起動時に開いた黒いコマンドプロンプト画面を閉じないでください。閉じるとComfyUIも終了します。
ACE-Step 1.5のテンプレートを開く
ComfyUIが起動したら、ACE-Step用のWorkflowを開きます。
私の日本語UIでは、左上の「メニュー」→「テンプレートを参照」と進むとテンプレート一覧を開けます。
テンプレート一覧を開いたら、左側の生成タイプから「オーディオ」を選びます。

私が確認した時点でも、ACE-Step 1.5だけで複数のテンプレートが表示されていました。
初心者なら「ACE-Step 1.5 音楽生成 AIO」がおすすめ
初めて使う場合は、まず「ACE-Step 1.5 音楽生成 AIO」を選ぶのが分かりやすいです。
AIOはAll-in-Oneの略で、通常は複数に分かれているモデルを1つのチェックポイントファイルへまとめた構成です。
今回使用するAIOモデルは、
ace_step_1.5_turbo_aio.safetensors
です。私が確認した時点では約9.34GBありました。
モデルが入っていなくてもComfyUIが教えてくれる
AIOテンプレートを開いた時点でモデルをまだ持っていなくても問題ありません。
今回、あえてAIOモデルを入れていない状態でテンプレートを開いてみたところ、画面右上に「1個の必要なモデルが不足しています」という警告が表示されました。

「不足しているモデルを表示」を押すと、必要なモデルを確認できます。

今回のAIOテンプレートでは、約9.34GBのモデル1個が必要であることが表示されました。
AIOモデルをダウンロードして配置する
不足モデルの画面で「ダウンロード」を押します。
今回使用したWindows Portable環境では、ブラウザによる通常のファイルダウンロードが始まりました。
ダウンロードしたファイルは、次の場所へ配置します。
ComfyUI_windows_portable
└─ ComfyUI
└─ models
└─ checkpoints
└─ ace_step_1.5_turbo_aio.safetensors
私の環境では、
D:\ComfyUI_windows_portable\ComfyUI\models\checkpoints\ace_step_1.5_turbo_aio.safetensors
になります。
モデルを置いたのに警告が消えない場合
今回の環境では、モデルを配置してからCtrl + F5でブラウザを再読み込みしたところ、モデルが認識され、不足モデルの表示が消えました。

Ctrl+F5でも認識されない場合は、一度ComfyUIを終了して、run_nvidia_gpu.batから起動し直してみるとよいと思います。
曲のプロンプトと歌詞は画面のどこに入力する?
モデルの準備が終わったら、次に音楽の内容を入力します。
ACE-StepのWorkflowで初心者が最初に探すのは、画面中央付近にある「Step 3 – Prompt」という大きな青いグループです。
この中にある「TextEncodeAceStepAudio1.5」ノードには、大きなテキスト入力欄が上下に2つあります。
上側の大きな欄:作りたい音楽の説明
ノード上側の大きなテキスト欄には、ジャンル、雰囲気、楽器、テンポ感、歌声の有無など、作りたい音楽の内容を入力します。
今回のテストでは、ここへ次の文章を入力しました。
uplifting fantasy orchestral background music, gentle strings, piano, light percussion, instrumental, emotional, game background music
今回は歌なしのBGMを作りたかったため、プロンプト内にもinstrumentalと入れています。
下側の「lyrics」欄:実際に歌わせる歌詞
上のプロンプト欄のすぐ下に、「lyrics」と表示されたもう1つの大きなテキスト欄があります。
ここは実際に歌わせたい歌詞を入力する場所です。
今回のように歌なしのBGMを作る場合は、lyrics欄は空欄のままでOKです。
逆に歌入りの曲を作る場合は、上側のプロンプト欄へ曲調を書き、下側のlyrics欄へ実際の歌詞を入力します。
曲の長さは左側の「Step 2 – Duration」
曲の長さは、Step 3 – Promptの左側にある「Step 2 – Duration」の中のSong Durationで設定します。
今回のテストでは30.0秒にしました。
初心者のうちは、まず次の3か所だけ分かれば十分です。
- Step 3 – Promptの上側:作りたい音楽の説明
- Step 3 – Promptのlyrics:歌わせたい歌詞
- Step 2 – Duration:曲の長さ
BPM、キー、CFGなどの細かな設定は、最初の1曲を作る段階ではテンプレートのままでも構いません。
実際にACE-Step 1.5で音楽を生成する
今回のテストでは、次の条件で30秒のインストゥルメンタル曲を生成しました。
- Song Duration:30秒
- Seed:31
- Steps:8
- Lyrics:空欄
入力できたら、画面上部にある青い「実行する」ボタンを押します。
生成が始まったら、あとは処理が終わるまで待ちます。
RTX 5070 Ti 16GBで30秒曲を生成した結果
今回のRTX 5070 Ti 16GB環境では、AIO版で30秒の音楽を正常に生成できました。
Prompt executed in 13.14 seconds
生成が終わると、Workflow右側の「オーディオ保存(MP3)」ノードに再生ボタンが表示され、その場で結果を確認できます。

初心者の場合は、「実行する」を押す → 右側のオーディオ保存ノードに再生ボタンが出るという流れをまず覚えておけば十分です。
生成時間はGPU、モデルのロード状態、VRAM、キャッシュ、曲の長さなどで変わるため、13.14秒という数値は今回の環境での一例です。
生成した音楽はどこに保存される?
標準設定では、生成物はComfyUIのoutputフォルダへ保存されます。
今回のWorkflowでは「オーディオ保存(MP3)」ノードを使用しているため、生成した音楽はMP3として保存されます。
ただし、私の普段の環境では起動BATに、
--output-directory "K:\ComfyUI_Output"
を追加して、出力先を変更しています。
そのため今回生成したファイルは、実際に、
K:\ComfyUI_Output\audio\ComfyUI_00001.mp3
K:\ComfyUI_Output\audio\ComfyUI_00002.mp3
K:\ComfyUI_Output\audio\ComfyUI_00003.mp3
へ保存されていました。
初心者の場合は最初から変更する必要はありません。まずは標準のoutputフォルダを使い、必要になってから保存先を変更すれば十分です。
私はモデルをSSD、生成ファイルをHDDに分けている
私の環境では、ComfyUI本体とAIモデルをSSDのDドライブ、生成した画像・動画・音楽などを大容量HDDのKドライブへ分けています。
モデルは起動時や初回ロード、モデル切り替え時などにストレージから読み込むので、私はモデル読み込み時の待ち時間を抑えるためSSDへ配置しています。
一方、生成済みの画像・動画・音声は数が増えやすいため、容量に余裕のあるHDDへ保存しています。
ただし、モデルをSSDへ置いたからといって、GPU上で行われる生成演算そのものが必ず高速になるという意味ではありません。
AIO版と分割モデル版はどちらを使えばいい?
今回、AIO版だけでなく分割モデル版でも生成を試しました。
初めてACE-Step 1.5を使うなら、私はまずAIO版をおすすめします。
分割版ではDiffusion Model、Text Encoder、VAEなどを個別に用意します。

この画像を見ると、中央の「Step 3 – Prompt」内に、上側の曲調入力欄と下側のlyrics欄があることが分かりやすいと思います。
分割版でも、音楽の入力方法自体は基本的に同じです。
同じ30秒条件で分割版を生成したところ、今回の実測は、
Prompt executed in 17.75 seconds
でした。

AIO版は13.14秒、分割版は17.75秒でしたが、これだけでAIO版の方が高速とは判断していません。
モデルのキャッシュやVRAM上の状態でも実行時間が変わるため、ここではどちらも正常に30秒曲を生成できたという実測値として掲載しています。
専用ACE-Step Portable版と比べてどうだった?
以前ACE-Step 1.5専用Portable版をWindowsへ導入した際には、私の環境では歌詞付き生成のNaN対策、起動オプション、モデル指定など、まともに動かすまでにかなり調整しました。
今回ComfyUI版を使って印象的だったのは、「まず1曲出す」までの流れがかなり整理されていることです。
テンプレートを選び、必要なモデルがなければComfyUIが知らせてくれ、モデルを指定されたフォルダへ配置すれば、そのままWorkflowを実行できます。
さらに初心者の場合も、まずは「Step 3 – Promptの上に曲調を書く」「歌わせる場合だけlyricsに歌詞を書く」「Step 2 – Durationで長さを決める」という3点から覚えれば、最初の1曲まで進みやすいと思います。
まとめ
ComfyUIでACE-Step 1.5を使ってみたところ、AIOテンプレートなら想像していたより簡単に音楽生成まで進められました。
初めてWorkflowを見ると項目が多く感じますが、最初に覚える場所はそれほど多くありません。
- Step 3 – Promptの上側:曲調・ジャンル・楽器などを書く
- Step 3 – Promptのlyrics:歌詞を書く。BGMなら空欄
- Step 2 – Duration:曲の長さを決める
- 画面上部の「実行する」:生成開始
- 右側の「オーディオ保存(MP3)」:生成結果を再生・確認する
この位置関係が分かれば、最初の1曲を作るところまではかなり迷いにくくなると思います。
まずはテンプレートをそのまま使い、曲調を入力して30秒程度の短い曲を1曲生成してみるところから始めるのがおすすめです。



コメント