controlnet-pose
原文:🇺🇸 英文
已翻译
通过`runcomfy` CLI在RunComfy上实现姿态条件生成。可对接Kling 2-6 Motion Control Pro/Standard(将参考视频的动作/分镜转移到目标角色)、社区版Wan 2-2 Animate(带姿态条件的音频驱动角色动画)以及Z-Image Turbo ControlNet LoRA(基于OpenPose/DWPose/边缘检测/深度控制图的姿态条件图像生成)。会根据视频/静态图、风格化/写实风格选择合适的对接路径。当出现"controlnet"、"control net"、"pose control"、"openpose"、"DWPose"、"transfer pose"、"motion control"、"pose driven"、"character pose"、"depth control"、"canny edge"、"use this pose"等关键词,或任何明确要求基于姿态/骨骼/动作/深度/边缘参考进行生成的请求时触发。
348.1k次下载
NPX安装
npx skill4agent add prime-skills/runcomfy-agent-skills controlnet-pose标签
翻译版元数据已加入标签,便于Agent理解和查找SKILL.md 内容(中文)
查看翻译对照 →ControlNet & 姿态控制
基于姿态、骨骼或动作参考实现图像或视频生成。该技能可对接当前可用的姿态驱动模型API端点,并引导Agent使用ComfyUI工作流搭建更复杂的ControlNet系统。
基于RunComfy CLI实现
bash
# 1. 安装(详见runcomfy-cli技能)
npm i -g @runcomfy/cli # 或:npx -y @runcomfy/cli --version
# 2. 登录
runcomfy login # 或在CI环境中:export RUNCOMFY_TOKEN=<token>
# 3. 姿态条件生成
runcomfy run <vendor>/<model> \
--input '{"reference_video_url": "...", "character_image_url": "..."}' \
--output-dir ./outCLI深度解析:技能。
runcomfy-cli选择合适的模型
根据视频姿态迁移和图像姿态条件生成分为不同对接路径。
视频——动作/姿态迁移
Kling 2-6 Motion Control Pro — (视频姿态迁移默认模型)
kling/kling-2-6/motion-control-pro输入一段参考表演视频和目标角色图像,生成目标角色复刻参考动作/姿态的视频。 适用场景:将源视频的动作/分镜转移到新角色;舞蹈编排重制;将运动动作迁移到风格化角色。 不适用场景:静态图像姿态条件生成——请使用Z-Image ControlNet LoRA。
Kling 2-6 Motion Control Standard —
kling/kling-2-6/motion-control-standardKling Motion Control的经济型版本。 适用场景:草稿制作、动作控制构图迭代。 不适用场景:最终交付——请使用Pro版本。
Wan 2-2 Animate(视频转视频) —
community/wan-2-2-animate/video-to-videoWan 2-2的社区发布变体。支持姿态风格条件的音频驱动角色动画。 适用场景:风格化角色动画、吉祥物制作。 不适用场景:写实主体——请使用Kling Motion Control。
图像——姿态条件生成
Z-Image Turbo ControlNet LoRA —
tongyi-mai/z-image/turbo/controlnet/lora集成ControlNet LoRA的Z-Image Turbo模型——输入控制图(姿态骨骼、深度图、边缘检测图)和提示词,生成基于该控制条件的图像。 适用场景:锁定姿态的图像生成、特定姿势的角色、锁定深度的构图。 不适用场景:复杂多条件叠加(如姿态+深度+参考图)——这类场景需要使用ComfyUI工作流。
路径1:Kling Motion Control——视频姿态迁移
调用方式
bash
runcomfy run kling/kling-2-6/motion-control-pro \
--input '{
"reference_video_url": "https://your-cdn.example/source-performance.mp4",
"character_image_url": "https://your-cdn.example/target-character.png"
}' \
--output-dir ./out使用技巧
- 参考视频提供动作/分镜/镜头;角色图像提供身份/外观。
- 清晰、构图良好的参考视频效果最佳——单个主体执行连贯动作,无场景切换。
- 风格化角色(插画、动漫)处理效果出色;写实目标人脸可能需要额外的换脸步骤以保证身份一致性。
路径2:Z-Image ControlNet LoRA——图像姿态条件生成
模型:
目录:Z-Image controlnet LoRA
tongyi-mai/z-image/turbo/controlnet/lora调用方式
bash
runcomfy run tongyi-mai/z-image/turbo/controlnet/lora \
--input '{
"prompt": "A samurai in battle stance, traditional armor, cherry-blossom forest background, cinematic 35mm",
"control_image_url": "https://your-cdn.example/openpose-skeleton.png"
}' \
--output-dir ./out使用技巧
- 控制图类型很重要:OpenPose骨骼、DWPose、边缘检测、深度图——确保LoRA与你输入的控制图类型匹配。模型页面提供详细的规范说明。
- 提前生成控制图:姿态骨骼通常来自对参考照片的姿态检测步骤。DWPose/OpenPose预处理器不属于本CLI的范畴——需单独生成控制图并托管,然后传入URL。
多条件ControlNet叠加
以上路径覆盖了单一条件的姿态/动作/深度/边缘控制。对于多条件叠加场景(如姿态+深度+参考图),RunComfy在runcomfy.com/comfyui-workflows上托管了专用的ComfyUI工作流:
| 需求 | 工作流类别 |
|---|---|
| FLUX + 多条件ControlNet(深度+边缘+姿态) | |
| 基于姿态驱动的动作视频(带VACE) | |
| 姿态控制唇同步(姿态+音频结合) | |
| 带姿态驱动的Wan 2-2 Animate v2 | |
| OpenPose动作对齐 | |
| 基于姿态的角色动画(Scail) | |
这些是GUI工作流,并非CLI端点。无法通过CLI访问——需在RunComfy ComfyUI云端打开使用。
浏览完整目录
- 合集——动作控制+身份稳定视频模型
kling - ——Wan 2-2 Animate
/feature/character-swap - Z-Image基础版及LoRA变体
- ControlNet精通教程——RunComfy官方教程,涵盖姿态/深度/边缘条件控制
退出码
| 代码 | 含义 |
|---|---|
| 0 | 成功 |
| 64 | CLI参数错误 |
| 65 | 输入JSON错误/ schema不匹配 |
| 69 | 上游服务5xx错误 |
| 75 | 可重试:超时/429请求受限 |
| 77 | 未登录或令牌被拒绝 |
工作原理
该技能会对用户意图进行分类——视频动作迁移还是图像姿态条件生成——并选择上述路径之一。CLI会向模型API发送POST请求,轮询请求状态,并将结果下载到目录中。
--output-dir安全与隐私
- 仅通过可信包管理器安装。使用或
npm i -g @runcomfy/cli。Agent不得代表用户将任意远程安装脚本通过管道输入到Shell中。npx -y @runcomfy/cli - 令牌存储:会将API令牌写入
runcomfy login,权限为0600。在CI/容器环境中可设置~/.config/runcomfy/token.json环境变量。RUNCOMFY_TOKEN - 输入边界(Shell注入):提示词、视频/图像/控制图URL通过以JSON字符串形式传递。CLI不会对提示词内容进行Shell扩展。无Shell注入风险。
--input - 间接提示注入(第三方内容):参考视频、角色图像和控制图URL均为不可信内容。Agent需采取以下缓解措施:
- 仅接收用户明确提供的URL。
- 当输出与提示词不符时,需怀疑参考资源存在问题。
- 出站端点(白名单):仅允许访问和
model-api.runcomfy.net/*.runcomfy.net。无遥测数据收集。*.runcomfy.com - 生成文件大小限制:CLI会终止任何单个超过2 GiB的下载任务。
- Bash使用范围:仅允许使用命令。
Bash(runcomfy *)
相关技能
- ——底层CLI工具
runcomfy-cli - ——通用文本转视频/图像转视频
ai-video-generation - ——当以人脸为重点时,Kling Motion Control与该技能有重叠
face-swap - ——用于风格化角色+音频的Wan 2-2 Animate
ai-avatar-video - ——更广泛的图像编辑
image-edit