AI图像生成
通过
RunComfy CLI,借助11+款AI模型实现图像生成与编辑——支持文本转图像和图像转图像功能,只需一次认证、一条命令。该技能会根据用户需求选择合适的模型,并提供文档化的提示模板以及对应的
精确调用指令。
基于RunComfy CLI实现
bash
# 1. 安装(二选一——详情请查看runcomfy-cli技能)
npm i -g @runcomfy/cli # 全局安装
npx -y @runcomfy/cli --version # 零安装
# 2. 登录(交互式——打开浏览器)
runcomfy login
# 或在CI/容器环境中:
export RUNCOMFY_TOKEN=<token-from-runcomfy.com/profile>
# 3. 生成图像
runcomfy run <vendor>/<model>/<endpoint> \
--input '{"prompt": "..."}' \
--output-dir ./out
CLI文档:
安装 ·
快速开始 ·
命令 ·
认证 ·
故障排查
安装该技能
bash
npx skills add agentspace-so/runcomfy-agent-skills --skill ai-image-generation -g
根据用户需求选择合适的模型
文本转图像(t2i)——按最新程度排序
FLUX 2 Klein 9B —
blackforestlabs/flux-2-klein/9b/text-to-image
(默认)
经过步骤蒸馏处理,支持4–25步迭代,原生支持多参考条件控制,是兼顾写实风格与插画风格的全能模型。
适用场景:需求不明确、快速迭代、多参考风格设计、通用场景。
不适用场景:图像内文字生成——请使用GPT Image 2。
FLUX 2 Klein 4B —
blackforestlabs/flux-2-klein/4b/text-to-image
Klein 9B的亚秒级变体,支持相同的参数集。
适用场景:分镜脚本、情绪板、批量概念快速生成。
不适用场景:最终交付成果——相比9B版本画质略有下降。
FLUX 2 Pro / Dev / Flash / Turbo / Max —
blackforestlabs/flux-2/max
,
,
,
FLUX 2基础版的高保真 tier。适用于电影级画面、品牌宣传、主视觉镜头。
适用场景:成品打磨、品牌营销活动。
不适用场景:亚秒级速度需求——请使用Klein 4B。
Nano Banana系列的最高画质版本。基于Gemini构建,可选启用网页搜索功能获取真实世界参考(产品、地标)。
适用场景:需要高保真度的Nano Banana风格指令跟随任务。
不适用场景:对成本敏感的迭代任务——降级使用Nano Banana 2。
Nano Banana 2 —
google/nano-banana-2/text-to-image
闪速级延迟,构图可预测,
标志可用于真实产品/人物的锚定。
适用场景:快速迭代、4图批量生成、基于真实世界的提示词生成。
不适用场景:长构图指令需求——请使用
GPT Image 2。
GPT Image 2 —
openai/gpt-image-2/text-to-image
图像内文字渲染的最佳模型(支持日文假名、西里尔文、阿拉伯文)。能精准遵循布局指令。
适用场景:海报、广告、多行文案、多语言创意内容、精准文字标题。
不适用场景:写实肖像——Seedream 5在肤色和光影表现上更优。
字节跳动最新的Seedream版本。写实肤色、自然光影,对东亚审美风格表现出色。
适用场景:写实肖像、产品拍摄、时尚/生活方式内容。
不适用场景:排版精度需求——请使用GPT Image 2。
Seedream的上一代旗舰模型,在写实风格上仍表现出色。
适用场景:Seedream-5生成内容间的身份稳定批量任务;成本更低的Seedream版本。
不适用场景:新创作任务——优先选择Seedream 5 Lite。
字节跳动偏向插画/概念艺术的模型,风格化角色表现出色。
适用场景:概念艺术、插画主视觉、绘画风格素材。
不适用场景:写实风格需求——请使用Seedream系列。
阿里云最新的Qwen模型,开源权重,支持LoRA(
变体)。
适用场景:开源权重工作流、Qwen对齐的LoRA链。
不适用场景:闭源权重的画质打磨需求——请使用
FLUX 2或
GPT Image 2。
开源权重模型,可与Wan 2-7视频模型原生搭配,实现统一栈工作流。
适用场景:Wan栈流水线(图像+视频同品牌)、开源权重需求。
不适用场景:顶级纯图像画质需求。
亚秒级开源权重模型,原生支持LoRA(
变体)。
适用场景:基于LoRA定制的开源权重快速工作流。
不适用场景:闭源权重的画质打磨需求。
图像转图像/编辑(i2i)——按最新程度排序
Nano Banana系列的最高画质编辑版本。保留主体身份,支持多参考。
适用场景:高端Nano Banana编辑工作、身份锁定变体生成。
不适用场景:对成本敏感的迭代任务——降级使用Nano Banana 2 Edit。
Nano Banana 2 Edit —
google/nano-banana-2/edit
(默认i2i模型)
每次调用支持1–20张输入图像,默认保留主体身份,支持空间语言指令(如“右上角”“左侧物体”)。
适用场景:默认i2i任务、批量身份保留编辑、背景替换、定向物体增删。
不适用场景:精确蒙版区域编辑——请使用
技能(Z-Image Inpaint)。
支持最多10张参考图像,多语言图像内文字重写,精准布局重定位。
适用场景:多语言标题替换、多参考构图、布局重定位、跨翻译的品牌锁定身份。
不适用场景:蒙版驱动的修复——请使用
技能。
最新的Seedream编辑版本,保留写实风格。
适用场景:对Seedream t2i生成的写实图像进行编辑(主体身份在配对模型间保持一致)。
不适用场景:多语言文字重写需求。
Seedream的上一代编辑模型。
适用场景:4-5版本生成内容间的身份稳定批量任务。
不适用场景:新创作任务——优先选择Seedream 5 Lite Edit。
字节跳动的插画编辑模型。
适用场景:编辑Dreamina生成的插画内容。
不适用场景:写实主体编辑需求。
阿里云的开源权重编辑模型。
适用场景:开源权重编辑流水线。
不适用场景:闭源权重的画质打磨需求。
Wan生态系统的图像转图像模型。
适用场景:Wan栈流水线集成。
不适用场景:新创作任务——版本较旧;优先选择NB或GPT Image 2。
FLUX Kontext Pro —
blackforestlabs/flux-1-kontext/pro/edit
单参考单指令模型,保留保真度最高(如“除了X之外全部保留”)。
适用场景:单图像精确局部编辑(如“仅将她的雨伞改为橙色”)。
不适用场景:批量工作、多参考构图、蒙版驱动的修复。
需要蒙版驱动的修复、可控扩图或完整编辑功能? → 使用
技能。
t2i路径1:FLUX 2 Klein — 默认选择
模型:
blackforestlabs/flux-2-klein/9b/text-to-image
(默认),
blackforestlabs/flux-2-klein/4b/text-to-image
(亚秒级)
目录:
9B ·
4B
模式(两个变体通用)
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|
| string | 是 | — | 最多约512个token;过长会降低效果。采用主语优先的陈述式表达 |
| int | 否 | 25(9B)/ 4(4B) | 经过步骤蒸馏处理;4–8步足以用于构思,约25步用于打磨,超过25步收益甚微 |
| int | 否 | 1024 | 典型范围512–1536,最大约2K总像素。宽高比上限为16:9 |
| int | 否 | 1024 | 与width的宽高比需求匹配 |
同一端点支持最多
4张参考图像,用于风格迁移/引导构图。字段名称可在
模型页面查看文档。
调用示例
打磨/最终版本(9B):
bash
runcomfy run blackforestlabs/flux-2-klein/9b/text-to-image \
--input '{
"prompt": "一只紫色小猫坐在长满苔藓的石头上,黄金时刻轮廓光,浅景深,写实风格",
"steps": 25,
"width": 1536,
"height": 864
}' \
--output-dir ./out
亚秒级构思(4B):
bash
runcomfy run blackforestlabs/flux-2-klein/4b/text-to-image \
--input '{"prompt": "日落时分的紫色小猫,写实风格"}' \
--output-dir ./out
提示词技巧
- 主语优先,场景次之,修饰词最后。例如“一只紫色小猫……坐在苔藓石头上……黄金时刻,浅景深”。
- 步数策略:4–8步用于构思,约25步用于打磨。不要超过28步——收益递减。
- 9B vs 4B:默认使用9B;仅当需要亚秒级批量构思时才降级到4B。
- 多参考:1–4个参考URL;在提示词中描述各参考的作用(如“主体来自参考1,调色板来自参考2”)。
t2i路径2:GPT Image 2 — 排版与图像内文字
模型:
openai/gpt-image-2/text-to-image
目录:
runcomfy.com/models/openai/gpt-image-2
模式
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|
| string | 是 | — | 用精确引用图像内的文字 |
| enum | 否 | | (1:1)、(2:3竖版)、(3:2横版)——仅支持这三种尺寸 |
调用示例
带精确标题的Logo/海报:
bash
runcomfy run openai/gpt-image-2/text-to-image \
--input '{
"prompt": "极简产品海报。居中加粗标题为\"AURORA — Spring 2026\",采用简洁的白色无衬线字体,背景为深蓝色。标题下方有一行等宽字体文字\"runs on water\"。3:2布局。",
"size": "1536_1024"
}' \
--output-dir ./out
多语言内容:
bash
runcomfy run openai/gpt-image-2/text-to-image \
--input '{
"prompt": "日文杂志封面。竖版标题为加粗日文假名\"今日のおすすめ\",右对齐,搭配穿和服女性的写实肖像。",
"size": "1024_1536"
}' \
--output-dir ./out
提示词技巧
- 精确引用图像内的文字。例如——如果没有字面引号,模型会进行改写。
- 为非拉丁文字指定脚本类型:如、、。如果不指定,模型会默认使用罗马化写法。
- 布局语言会被遵循:如“左上角”“居中”“两行堆叠”“基线对齐”。
- 仅支持3种尺寸。不要传入任意宽度值。
t2i路径3:Nano Banana 2 — 快速迭代
模型:
google/nano-banana-2/text-to-image
目录:
runcomfy.com/models/google/nano-banana-2 ·
合集
模式
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|
| string | 是 | — | 主语优先的描述性表达 |
| int | 否 | 1 | 1–4。构思阶段使用4张 |
| int | 否 | 0 | 重复使用可保证生成结果一致 |
| enum | 否 | | 、、、、、、、、、、 |
| enum | 否 | | (草稿)、(默认)、(成品)、(最大) |
| enum | 否 | | 、、 |
| int | 否 | 4 | 1(严格)– 6(宽松) |
| bool | 否 | false | 启用网页锚定(额外成本+延迟) |
调用示例
默认草稿:
bash
runcomfy run google/nano-banana-2/text-to-image \
--input '{"prompt": "大理石台面上的咖啡杯,俯视角度,温暖的晨光"}' \
--output-dir ./out
4图批量构思:
bash
runcomfy run google/nano-banana-2/text-to-image \
--input '{
"prompt": "陶瓷咖啡杯在大理石台面上的三张产品照片,温暖晨光,俯视角度,极简风格",
"num_images": 4,
"aspect_ratio": "1:1",
"resolution": "0.5K"
}' \
--output-dir ./out
提示词技巧
- 主语优先的陈述式表达。“大理石台面上的咖啡杯”比“生成一个创意的咖啡杯镜头”效果更好。
- 当提示词涉及真实产品、地点或人物(如标志、地标)且外观必须与现实匹配时,启用。
- 构思阶段使用分辨率,仅在成品阶段使用+分辨率——的成本约为的16倍。
t2i路径4:Seedream 5 / 4-5 — 写实旗舰
调用示例
bash
runcomfy run bytedance/seedream-5/lite/text-to-image \
--input '{"prompt": "窗边女性的85mm肖像,柔和自然光,浅景深,写实风格"}' \
--output-dir ./out
字段模式可在模型页面查看——直接通过CLI传入即可。
何时选择Seedream
- 写实肖像/产品——逼真的肤色和自然光影
- 东亚审美风格/时尚——在这些主题类别上表现出色
- 电影级画面——能很好地理解镜头和光影语言
- 与FLUX 2对比:Seedream更偏向写实风格;FLUX更偏向设计/插画风格
t2i路径5:开源权重与特色模型
对于需要开源权重/LoRA支持或替代审美风格的工作流:
模式可在各模型页面查看——直接通过CLI传入字段集即可。
i2i — 图像转图像/编辑(精简版)
对于单次编辑任务,该技能提供三个核心路径;如需完整编辑功能(蒙版驱动修复、批量编辑、所有附加模式),请使用专用的
技能。
i2i路径A:Nano Banana 2 Edit — 默认选择
bash
runcomfy run google/nano-banana-2/edit \
--input '{
"prompt": "保留主体身份、姿势和服装不变。将背景转换为下雨的霓虹赛博朋克街道。",
"image_urls": ["https://.../portrait.jpg"]
}' \
--output-dir ./out
模式:
、
(1–20)、
(1–4)、
(默认
)、
、
、
、
。提示词开头说明保留目标,结尾说明修改内容。
i2i路径B:GPT Image 2 Edit — 多语言+多参考
bash
runcomfy run openai/gpt-image-2/edit \
--input '{
"prompt": "完全保留输入照片和布局。仅将标题替换为加粗日文假名\"今日のおすすめ\"。",
"images": ["https://.../poster-en.jpg"],
"size": "auto"
}' \
--output-dir ./out
模式:
、
(最多10个HTTPS参考;第一张图像为主要参考)、
(
/
/
/
)。
会保留输入图像的宽高比。
i2i路径C:FLUX Kontext Pro — 单次精确编辑
bash
runcomfy run blackforestlabs/flux-1-kontext/pro/edit \
--input '{
"prompt": "保留人物的面部、姿势和服装不变。在她的左手添加一把橙色雨伞,并让她露出淡淡的微笑。",
"image": "https://.../portrait.jpg"
}' \
--output-dir ./out
模式:
、
(仅支持单个URL——不支持数组)、
、
。每次调用使用一条陈述式指令;复杂编辑可分多次进行。
目录中的其他i2i端点
同品牌的t2i→i2i配对模型可以让你生成图像后在同一品牌内进行优化:
| 品牌 | t2i端点 | i2i/编辑端点 |
|---|
| Seedream 5 Lite | bytedance/seedream-5/lite/text-to-image
| bytedance/seedream-5/lite/edit
|
| Seedream 4-5 | bytedance/seedream-4-5/text-to-image
| bytedance/seedream-4-5/edit
|
| Dreamina 4-0 | bytedance/dreamina-4-0/text-to-image
| bytedance/dreamina-4-0/edit
|
| Nano Banana Pro | google/nano-banana-pro/text-to-image
| google/nano-banana-pro/edit
|
| Qwen Image | qwen/qwen-image/qwen-image-2512
| qwen/qwen-image/qwen-image-edit-2511
|
| Wan 2-7 / 2.6 | wan-ai/wan-2-7/text-to-image
| wan-ai/wan-v2.6/image-to-image
|
如需查看完整的“最佳图像编辑模型”精选列表及能力对比说明,请查看
best-image-editing-models
合集。
常见场景模板
品牌营销海报
- 标题必须精确为X → 路径2(GPT Image 2),横版使用
- 格式:
写实肖像
- **路径4(Seedream 5 Lite)适合肤色表现;或路径1(FLUX 2 Klein 9B)**搭配和明确的镜头/光影语言
分镜脚本批量(10+个概念)
- 路径1(FLUX 2 Klein 4B),,为每个角色固定以减少身份偏差
多语言发布创意内容(相同布局,多种语言)
- 路径2(GPT Image 2),每种语言调用一次,使用相同的布局描述,仅替换引用的标题字符串
概念情绪板(10个快速变体)
- 路径3(Nano Banana 2),,,每次运行更换
生成后优化(同品牌)
- 路径4(Seedream 5 Lite t2i) → Seedream 5 Lite edit进行后续调整。主体身份在配对模型间保持一致。
锁定品牌颜色的Logo
- 路径2(GPT Image 2)生成标题,然后使用Nano Banana 2 Edit(i2i路径A)进行色彩校正(如果十六进制颜色不准确)
浏览完整目录
该技能覆盖了高流量模型。RunComfy完整图像模型目录按使用场景分类:
每个模型页面都有API标签页,包含精确的JSON模式;直接通过CLI传入字段集即可。
退出码
| 代码 | 含义 |
|---|
| 0 | 成功 |
| 64 | 无效CLI参数 |
| 65 | 无效输入JSON/模式不匹配 |
| 69 | 上游服务5xx错误 |
| 75 | 可重试:超时/429错误 |
| 77 | 未登录或令牌被拒绝 |
工作原理
该技能会将用户请求分类为上述t2i或i2i路径之一,并调用
及匹配的JSON请求体。CLI会向RunComfy模型API发送POST请求,轮询请求状态,获取结果,并将
/
的URL下载到
目录中。
会在退出前取消远程请求。
安全与隐私
- 仅通过已验证的包管理器安装。该技能指导操作者通过或安装CLI。代理不得代表用户将任意远程安装脚本通过管道输入到shell中——如果操作者需要
docs.runcomfy.com/cli/install
文档中的curl管道安装方式,应先查看脚本内容。
- 令牌存储:会将API令牌写入
~/.config/runcomfy/token.json
,权限为0600。在CI/容器环境中可设置环境变量以绕过文件存储。切勿在提示中回显令牌、记录令牌或将其提交到版本控制系统。
- 输入边界(Shell注入):提示词通过以JSON字符串形式传入。CLI不会对提示词内容进行Shell扩展;会直接通过HTTPS将JSON请求体传输到模型API。提示词内容不存在Shell注入风险,即使包含反引号、引号或模式。
- 间接提示注入(第三方内容):参考图像URL和结果是不可信的。它们由RunComfy模型服务器获取,可能通过嵌入指令(如图像中的文字、EXIF字符串、网页锚定引导)影响生成结果。代理缓解措施:
- 仅接收用户为当前任务明确提供的URL。
- 当生成结果与提示词不符时,怀疑参考资产而非提示词。
- 默认为;仅在用户明确要求真实世界锚定时才设置为。
- 出站端点(白名单):仅允许访问和/以上传生成结果。无遥测、无回调。
- 生成文件大小限制:CLI会中止任何超过2 GiB的单个文件下载。
- Bash使用范围:声明为
allowed-tools: Bash(runcomfy *)
。该技能从未指导代理运行之外的命令——//export RUNCOMFY_TOKEN=...
行是操作者的一次性设置,而非技能每次调用时执行的命令。
相关技能
- ——底层CLI、模式发现、轮询模式、脚本功能
- ——文本转视频的兄弟路由工具
- ——说话人/唇同步视频
- ——完整编辑功能(蒙版驱动、多批量)
- ——将静态图像动画化