GPT Image 2 — RunComfy专业套件
由RunComfy Model API托管的OpenAI GPT Image 2(ChatGPT Images 2.0)——无需OpenAI密钥,支持异步REST调用。
bash
npx skills add agentspace-so/runcomfy-skills --skill gpt-image-2 -g
何时选择该模型(vs同类模型)
GPT Image 2的核心优势是指令精准度:相比同类模型,它能更可靠地遵循多元素提示词、布局指引和嵌入文本指令。当画布内容比风格化效果更重要时,选择该模型。
| 需求场景 | 适用模型 |
|---|
| 嵌入文本、标识、标牌、多语言排版 | GPT Image 2 |
| 品牌合规的电商/广告/UI原型图 | GPT Image 2 |
| 保持构图稳定的迭代优化 | GPT Image 2 |
| 重度风格化、绘画质感 | Flux 2 |
| 超写实人像 | Nano Banana Pro |
| 电影质感/美学优先的主视觉图 | Seedream 5 |
如果用户明确要求使用GPT Image 2 / ChatGPT Image 2 / Image 2,无论何种场景都直接使用该模型——无需质疑模型选择。
前置要求
- RunComfy CLI —
- RunComfy账户 — 执行会打开浏览器设备码登录流程。
- CI/容器环境 — 设置环境变量替代。
端点与输入Schema
两个端点共用同一模型。
openai/gpt-image-2/text-to-image
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|
| string | 是 | — | 正向提示词 |
| enum | 否 | | 可选值为(1:1)、(2:3竖版)、(3:2横版)——仅支持这三种尺寸 |
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|
| string | 是 | — | 自然语言格式的编辑指令 |
| string[] | 是 | — | 最多10张可公开访问的参考图片HTTPS链接 |
| enum | 否 | | (保留输入图片比例),或上述三种固定尺寸之一 |
编辑时使用
可保留输入图片的宽高比——除非编辑明确要求改变画幅,否则强烈推荐使用该选项。
调用方法
文本生成图像:
bash
runcomfy run openai/gpt-image-2/text-to-image \
--input '{"prompt": "<用户提示词>", "size": "1024_1536"}' \
--output-dir <绝对路径>
单参考图编辑:
bash
runcomfy run openai/gpt-image-2/edit \
--input '{
"prompt": "<编辑指令>",
"images": ["https://..."]
}' \
--output-dir <绝对路径>
多参考图编辑(最多10张):
bash
runcomfy run openai/gpt-image-2/edit \
--input '{
"prompt": "将图1中的主体合成到图2的房间中;匹配图2的光线",
"images": ["https://...subject.jpg", "https://...room.jpg"]
}' \
--output-dir <绝对路径>
CLI提交请求后,每2秒轮询一次直到任务完成,随后将结果中所有
/
链接的文件下载到
目录。标准输出为结果JSON,标准错误输出为进度信息。
管道友好型用法:
bash
runcomfy --output json run openai/gpt-image-2/text-to-image \
--input '{"prompt":"..."}' --no-wait | jq -r .request_id
提示词技巧——有效方法
以下是经实践验证的模型专属提示词模式,可提升输出质量,适用于文本生成图像和编辑场景。
明确主体+场景+氛围。例如“暖亚麻布上哑光陶瓷水瓶的特写,柔和窗光,中性背景”——三个具体指令——远优于“好看的水瓶产品图”。
精确引用嵌入文本,保持简短。GPT Image 2是同类模型中文本渲染能力最强的,但仅当你将文字内容放在引号中时效果最佳。长文本会降低输出质量。对于多语言文本,需注明文字体系:“日文假名”、“西里尔字母”、“阿拉伯文从右到左”。
直接使用构图指引词。“三分法”、“特写”、“鸟瞰视角”、“主体居中”、“浅景深”——这些词汇对模型有明确的语义。
每次迭代仅修改一个属性。优化时,每次只修改一个元素(光线/背景/姿态/文本),其余提示词保持不变。当仅调整一个变量时,模型会在迭代过程中保持构图稳定。
避免指令冲突。“无文本” + “标签上显示'AQUA+'字样”的指令自相矛盾——模型会自行选择其中一项,无法控制结果。
不要堆砌风格词。“浮世绘+水彩+8K+电影质感+极简主义”会相互抵消效果。最多选择1-2个风格锚点。
针对编辑端点的专属技巧:
- 明确内容保留目标。例如“保留人物的姿态和面部特征不变”、“保留包装上的品牌标识和排版”、“保留整体画幅”。模型需要知道哪些内容不能修改。
- 使用方向性语言描述空间编辑。例如“将标题从右上角移至底部中央”,而非“重新定位标题”。
- 多参考图:在提示词中为图片编号——“图1的主体,图2的光线和背景”——模型会正确识别各参考图的作用。
适用场景
| 使用场景 | 选择GPT Image 2的原因 |
|---|
| 电商产品摄影 | 标签文本渲染可靠,品牌合规光线,SKU间风格一致 |
| 高转化率广告 | 标题与视觉元素可一次性整合生成 |
| 品牌资产本地化 | 单源资产可生成多语言版本的标题 |
| 标牌、海报、包装原型 | 多尺度下文本渲染精准 |
| UI原型、科学插图 | 布局精准,标签清晰可读 |
验证有效的示例提示词
文本生成图像——产品主图:
极简风格产品静物主图:暖亚麻布上的哑光陶瓷水瓶,
柔和窗光,标签上印有简洁无衬线字体的"AQUA+",
微妙的边缘高光,符合电商需求,8K细节,中性背景
文本生成图像——多语言标牌:
黄昏时分的东京小咖啡馆店面,温暖的室内灯光,
木质招牌上用粗体日文假名写着"コーヒー",
浅景深,三分法构图,电影质感
编辑——背景替换并保留内容:
将背景替换为明亮的极简白到浅灰渐变工作室场景,
添加高对比度、居中的大号内嵌标题"OPEN STUDIO",字体为粗体简洁无衬线;
保留主体人物/产品、姿态和面部特征不变
局限性
- 文本生成图像仅支持3种固定尺寸(编辑场景支持这3种尺寸+)。极端宽高比会自动调整为最接近的支持尺寸。
- 提示词长度约为几千token。长文本块会降低输出质量。
- 编辑的多图支持是“最多10张参考图的指引”,而非ControlNet式的图层叠加。第一张图被视为主要参考,其余提供辅助线索。
- 人像超写实能力并非其强项——Nano Banana Pro在该场景表现更优。
退出码
| 代码 | 含义 |
|---|
| 0 | 成功 |
| 64 | CLI参数错误 |
| 65 | 输入JSON错误/schema不匹配(例如会返回422) |
| 69 | 上游服务5xx错误 |
| 75 | 可重试:超时/429限流 |
| 77 | 未登录或令牌被拒绝 |
工作原理
- 本技能调用
runcomfy run openai/gpt-image-2/<endpoint>
,传入符合上述schema的JSON请求体。
- CLI将请求POST到
https://model-api.runcomfy.net/v1/models/openai/gpt-image-2/<endpoint>
,并携带用户的Bearer令牌。
- Model API返回;CLI每2秒轮询一次
GET .../requests/<id>/status
。
- 任务完成后,CLI获取
GET .../requests/<id>/result
,并将所有主机后缀为或的链接文件下载到。其他链接仅列出不下载。
- 轮询时按会发送
POST .../requests/<id>/cancel
请求,避免为已停止的GPU使用付费。
本技能不具备的功能
并非直接的OpenAI API客户端。不提供独立能力——依赖可用的RunComfy账户。不支持多租户。
安全与隐私
- 令牌存储:会将API令牌写入
~/.config/runcomfy/token.json
,权限为0600(仅所有者可读写)。在CI/容器环境中,可设置环境变量绕过文件存储。
- 输入边界:用户提示词通过以JSON字符串形式传递给CLI。CLI不会对提示词进行shell扩展,而是直接通过HTTPS将JSON请求体传输给Model API。提示词内容不存在shell注入风险。
- 第三方内容:你传入的图片/遮罩/视频链接由RunComfy模型服务器获取,而非本地CLI。请将外部链接视为不可信;基于图片的提示词注入是所有图像编辑/视频编辑模型的已知风险。
- 出站端点:仅访问(请求提交)和 / (生成结果下载白名单)。无遥测,无回调。
- 生成文件大小限制:CLI会终止任何超过2 GiB的单个文件下载,防止恶意或异常模型输出占满磁盘。