Loading...
Loading...
通过`runcomfy` CLI在RunComfy平台使用ACE Step生成、修复(inpaint)和扩展(outpaint)音乐。ACE Step是StepFun-AI推出的开源权重音乐基础模型——支持标签驱动创作(涵盖流派、情绪、乐器)、带段落标记的多语种歌词,可生成5秒至4分钟的立体声输出,每秒成本为0.0002–0.0003美元(约比ElevenLabs Music便宜27倍)。提供四个端点:ACE Step文本转音频(默认选项)、ACE Step 1.5文本转音频(支持50+语种歌词,优化了结构化歌词处理)、ACE Step音频修复(重新生成现有音轨中的指定时间段内容)、ACE Step音频扩展(在现有音轨的前后添加内容)。当触发词为“ace step”、“ace-step”、“acestep”、“ACE music”、“open music model”、“cheap AI music”、“inpaint audio”、“audio inpaint”、“extend music”、“audio outpaint”、“lengthen track”、“music with tags”,或任何明确要求使用ACE Step生成或编辑音乐的指令时,该工具将启动。
npx skill4agent add prime-skills/runcomfy-agent-skills ace-stepnpx skills add agentspace-so/runcomfy-agent-skills --skill ace-step -gruncomfy-clinpm i -g @runcomfy/cli # 全局安装
npx -y @runcomfy/cli --version # 零安装方式RUNCOMFY_TOKENruncomfy loginruncomfy run acestep-ai/ace-step/text-to-audio \
--input '{"tags": "..."}' \
--output-dir ./outruncomfy-cliacestep-ai/ace-step-1.5/text-to-audioACE Step最新版本的生成功能。支持50+语种人声,优化了结构化歌词处理,其余特性与基础版一致。成本略高(每秒0.0003美元,基础版为0.0002美元)。 适用场景:多语种歌词、高质量人声曲目、需要清晰段落结构的人声歌曲。 不适用场景:对成本敏感的批量任务,且基础模型已能满足需求。
acestep-ai/ace-step/text-to-audioACE Step原版模型。支持标签驱动创作、可选歌词,可生成5–240秒立体声。每秒0.0002美元——约比ElevenLabs Music便宜27倍。 适用场景:大批量草稿生成、背景音乐、广告配乐、游戏循环音、对成本敏感的迭代任务。 不适用场景:追求极致打磨的商业人声钩子——此类场景可尝试ACE Step 1.5或ElevenLabs Music。
acestep-ai/ace-step/audio-inpaint重新生成现有音轨中的指定时间段内容(非基于蒙版;使用以音轨开头或结尾为锚点的/start_time参数,单位为秒)。 适用场景:修复中间糟糕的副歌、替换桥段、重新生成20秒片段而无需重新渲染整首歌曲。 不适用场景:非时间范围限定的编辑——此类操作不符合该端点的模式。end_time
acestep-ai/ace-step/audio-outpaint双向扩展现有音轨——在前面添加前奏、后面添加尾声,或同时添加两者。 适用场景:将30秒草稿延长为2分钟版本、添加淡入效果、围绕现有钩子构建更长的编曲。 不适用场景:将音轨总时长扩展至4分钟以上——可通过多次调用实现。
acestep-ai/ace-step/text-to-audioacestep-ai/ace-step-1.5/text-to-audio| 字段(Field) | 类型(Type) | 是否必填(Required) | 默认值(Default) | 说明(Notes) |
|---|---|---|---|---|
| 字符串 | 是 | — | 逗号分隔的流派/情绪/乐器标签,用于驱动创作 |
| 字符串 | 否 | — | 人声内容。使用段落标记 |
| 整数 | 否 | | 音频时长(秒)。范围5–240(单次调用最长4分钟) |
| 整数 | 否 | | 用于复现结果; |
runcomfy run acestep-ai/ace-step/text-to-audio \
--input '{
"tags": "lo-fi hip-hop, mellow, vinyl crackle, rhodes piano, soft drums, 75 BPM",
"lyrics": "[inst]",
"duration": 90
}' \
--output-dir ./outruncomfy run acestep-ai/ace-step-1.5/text-to-audio \
--input '{
"tags": "indie pop, anthemic, electric guitar, driving drums, female vocal, 120 BPM",
"lyrics": "[Verse]\nChalk on the palms, laces double-knotted\nMorning on the ridge, the sun is rising\n[Chorus]\nWe rise, we strike, we never fade out\nWe rise, we strike, we sing it loud\n[Bridge]\nSoft piano breakdown\n[Outro]\nFull band, fade",
"duration": 60
}' \
--output-dir ./out"lo-fi hip-hop, mellow, vinyl crackle, rhodes piano, soft drums, 75 BPM""chill music"[Verse][Chorus][Bridge][Outro]"lyrics": "[inst]""[instrumental]""japanese vocal, j-pop""seed": 42-1acestep-ai/ace-step/audio-inpaint| 字段(Field) | 类型(Type) | 是否必填(Required) | 默认值(Default) | 说明(Notes) |
|---|---|---|---|---|
| 字符串 | 是 | — | MP3/WAV/FLAC格式的HTTPS URL。最长支持60分钟 |
| 字符串 | 是 | — | 逗号分隔的标签,用于引导重新生成的片段风格 |
| 浮点数 | 否 | — | 可编辑片段的开始时间(秒),范围0–240 |
| 枚举值 | 否 | | |
| 浮点数 | 否 | | 可编辑片段的结束时间(秒),范围0–240 |
| 枚举值 | 否 | | |
| 字符串 | 否 | — | 重新生成片段的歌词。留空则由模型生成; |
| 整数 | 否 | | 用于复现结果 |
start_timeend_timeruncomfy run acestep-ai/ace-step/audio-inpaint \
--input '{
"audio": "https://your-cdn.example/original-track.mp3",
"tags": "indie pop, breakdown, piano only, soft, no drums",
"start_time": 20,
"end_time": 40,
"lyrics": "[inst]"
}' \
--output-dir ./outruncomfy run acestep-ai/ace-step/audio-inpaint \
--input '{
"audio": "https://your-cdn.example/song.mp3",
"tags": "indie pop, fade, soft, ambient pad",
"start_time": 15,
"start_time_relative_to": "end",
"end_time": 0,
"end_time_relative_to": "end"
}' \
--output-dir ./out_relative_to: "end"acestep-ai/ace-step/audio-outpaint| 字段(Field) | 类型(Type) | 是否必填(Required) | 默认值(Default) | 说明(Notes) |
|---|---|---|---|---|
| 字符串 | 是 | — | MP3/WAV/FLAC格式的HTTPS URL。最长支持60分钟 |
| 字符串 | 是 | — | 用于引导扩展部分风格的标签 |
| 浮点数 | 否 | | 在原音轨之前添加的新音频时长(秒),范围0–240 |
| 浮点数 | 否 | | 在原音轨之后添加的新音频时长(秒),范围0–240 |
| 字符串 | 否 | — | 扩展部分的可选歌词 |
| 整数 | 否 | | 用于复现结果 |
runcomfy run acestep-ai/ace-step/audio-outpaint \
--input '{
"audio": "https://your-cdn.example/hook-30s.mp3",
"tags": "indie pop, electric guitar, drums, build-up before chorus, fade outro",
"extend_before_duration": 30,
"extend_after_duration": 60,
"lyrics": "[inst]"
}' \
--output-dir ./outruncomfy run acestep-ai/ace-step/audio-outpaint \
--input '{
"audio": "https://your-cdn.example/track.mp3",
"tags": "ambient pad, soft fade, low volume tail",
"extend_before_duration": 0,
"extend_after_duration": 20
}' \
--output-dir ./outextend_before_durationextend_after_duration| 维度 | ACE Step | ElevenLabs Music |
|---|---|---|
| 成本 | $0.0002–0.0003 / 秒 | $0.0083 / 秒(约贵27倍) |
| 许可证 | 开源权重(Apache 2.0) | 商业授权,ElevenLabs托管 |
| 多语种人声 | 50+语种(1.5版本) | 强大的多语种支持 |
| 结构化歌词 | | |
| 单次调用最长时长 | 240秒(4分钟) | 300秒(5分钟) |
| 音频修复/扩展 | 支持(基于时间范围) | 不支持 |
| 标签驱动创作 | 支持(tags为必填字段) | 风格作为自由文本提示的一部分 |
| 最佳适用场景 | 对成本敏感的批量任务、草稿生成、修复/扩展工作流、开源权重管道 | 高品质人声歌曲钩子、打磨后的商业作品 |
ai-music[inst]lyricsstart_timeend_time| 代码 | 含义 |
|---|---|
| 0 | 成功 |
| 64 | CLI参数错误 |
| 65 | 输入JSON错误/模式不匹配 |
| 69 | 上游服务5xx错误 |
| 75 | 可重试:超时/429错误 |
| 77 | 未登录或令牌被拒绝 |
runcomfy run--output-dirnpm i -g @runcomfy/clinpx -y @runcomfy/clidocs.runcomfy.com/cli/installruncomfy login~/.config/runcomfy/token.jsonRUNCOMFY_TOKEN--inputaudiomodel-api.runcomfy.net*.runcomfy.net*.runcomfy.comallowed-tools: Bash(runcomfy *)runcomfy <subcommand>runcomfy-clielevenlabs-music-generationai-music