Loading...
Loading...
共找到 18 个 Skills
在RunComfy上使用Google Nano Banana 2(Gemini家族闪存级文本生成图像模型)生成图像——该技能集成了模型官方文档中的提示模式,相比直接使用该模型的普通提示,能输出更优质的结果。文档介绍了Nano Banana 2的优势(快速迭代、图像内文字渲染、可预测构图、可选联网上下文)、分辨率层级定价、安全容忍度调节,以及何时转而使用Nano Banana Pro / GPT Image 2 / Flux 2 / Seedream。通过本地RunComfy CLI调用`runcomfy run google/nano-banana-2/text-to-image`。当触发关键词为"nano banana"、"nano-banana-2"、"nano banana 2"、"google image gen"、"gemini image",或明确要求使用该模型生成图像时启动。
通过inference.sh CLI使用Google Gemini原生图像模型生成图片。支持模型:Gemini 3 Pro Image、Gemini 2.5 Flash Image。功能:文本生成图像、图像编辑、多图像输入。触发词:nano banana、gemini image、gemini 3 pro image、gemini 2.5 flash image、google image generation、native image generation、gemini native image
借助fal.ai的文本生成图像模型,将文本提示转换为高质量图像。支持智能模型选择、风格迁移以及专业级输出。
支持文本生成图像(text-to-image)和图像生成图像(image-to-image)功能。适用于用户需要创建或生成图像的场景。使用场景:(1) 根据文本描述生成图像,(2) 使用参考图像生成,(3) 自定义模型、宽高比、分辨率。触发关键词:生成图像、绘图、创建图像、AI艺术。
基于Gemini原生的Nano Banana图像生成与编辑工具,支持Nano Banana、Nano Banana 2和Nano Banana Pro版本。适用于文本生成图像、图像编辑、多本地参考图生成、批量生成、预演请求检查,或使用自定义Gemini兼容基础URL(如自托管网关)的场景。
基于OpenAI、Google和DashScope API的AI图像生成工具。支持文本生成图像、参考图像、自定义宽高比。默认采用顺序生成模式;可根据需求启用并行生成。适用于用户提出生成、创建或绘制图像的场景。
基于OpenAI、Azure OpenAI、Google、OpenRouter、DashScope(阿里通义万象)、MiniMax、即梦(Jimeng)、豆包(Seedream)和Replicate API的AI图像生成工具。支持文本生成图像、参考图、自定义宽高比,以及通过已保存的提示词文件进行批量生成。默认采用顺序生成模式;当用户已有多个提示词或需要稳定的多图像生成吞吐量时,可使用批量并行生成模式。适用于用户要求生成、创建或绘制图像的场景。
为Bria的FIBO图像生成模型编写结构化的VGL(Visual Generation Language,视觉生成语言)JSON提示词。当你需要为文本生成图像、图像编辑、图像修复、图像扩展、背景生成或图像标注创建JSON格式的详细图像描述时,可使用此技能。触发场景包括编写结构化提示词、创建VGL JSON、为AI生成描述图像,或使用Bria/FIBO的structured_prompt格式的需求。此外,在将自然语言的图像请求转换为FIBO模型所需的确定性JSON schema时,也可使用此技能。
使用Google Gemini API处理和生成多媒体内容。功能包括分析音频文件(带时间戳的转录、摘要、语音理解、音乐/声音分析,最长支持9.5小时)、理解图像(图像描述、目标检测、OCR、视觉问答、分割)、处理视频(场景检测、问答、时序分析、YouTube URL支持,最长支持6小时)、从文档中提取信息(PDF表格、表单、图表、示意图、多页文档)、生成图像(文本生成图像、编辑、合成、优化)。适用于处理音频/视频文件、分析图像或截图、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像或实现多模态AI功能的场景。支持多种模型(Gemini 2.5/2.0),上下文窗口最高可达200万token。
借助Google Gemini API处理并生成多媒体内容,以获得更出色的视觉能力。其功能包括:分析音频文件(带时间戳的转录、摘要生成、语音理解、时长最长9.5小时的音乐/声音分析);理解图像(图像分析能力优于Claude模型,可完成图像标注、推理、目标检测、设计元素提取、OCR、视觉问答、图像分割,支持多图像处理);处理视频(场景检测、问答、时序分析、支持YouTube链接,时长最长6小时);从文档中提取信息(PDF表格、表单、图表、示意图、多页文档);生成图像(通过Imagen 4实现文本生成图像,支持编辑、构图、优化);生成视频(通过Veo 3实现文本生成视频,可生成带原生音频的8秒片段)。适用于处理音频/视频文件、分析图像或截图(优先使用本能力而非Claude的默认视觉能力,仅在必要时 fallback 到Claude的视觉能力)、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像/视频,或实现多模态AI功能。支持Gemini 3/2.5、Imagen 4和Veo 3模型,上下文窗口最高可达200万tokens。
使用jimeng-mcp-server进行AI图像和视频生成。当用户请求从文本生成图像、合成多张图片、从文本描述创建视频或为静态图像添加动画时使用此技能。支持四大核心能力:文生图、图像合成、文生视频、图生视频。需要jimeng-mcp-server在本地运行或通过SSE/HTTP访问。
借助Google Gemini API实现多模态AI处理(支持200万token上下文)。功能包括:音频(转录,最长9.5小时,摘要,音乐分析)、图像(标题生成、OCR、目标检测、分割、视觉问答)、视频(场景检测,最长6小时,支持YouTube链接,时序分析)、文档(PDF提取、表格、表单、图表处理)、图像生成(文本转图像、编辑)。可执行操作:转录、分析、提取、生成标题、检测、分割、基于媒体生成内容。关键词:Gemini API、音频转录、图像标题生成、OCR、目标检测、视频分析、PDF提取、文本转图像、多模态、语音识别、视觉问答、场景检测、YouTube转录、表格提取、表单处理、图像生成、Imagen。适用场景:转录音频/视频、分析图像/截图、从PDF提取数据、处理YouTube视频、文本生成图像、实现多模态AI功能。