Loading...
Loading...
共找到 63 个 Skills
imagine 是一款多提供商的命令行工具,可通过 Google Gemini、Google Vertex AI 和 OpenAI(gpt-image-2)生成和编辑图像。
通用AI图像生成工具,支持OpenAI DALL·E / gpt-image、Google Gemini Image / Imagen、Replicate(Flux / SDXL / 任意模型)、Stability AI、FAL、Ark(Seedream 4.5)、Bailian(qwen-image / wanx)以及SiliconFlow。当用户要求根据文本提示或参考图像生成、创建、绘制、制作插图、渲染或合成图像时,使用此技能。典型表述包括“draw a ...”“generate an image of ...”“画一张 ...”“给我来张图”“make a poster of ...”“create an illustration ...”,或者提及任何图像生成模型系列,如DALL·E、gpt-image、Flux、SDXL、Seedream、Imagen、Gemini image、Kolors或Wanx。即使用户未指定具体模型,也务必使用此技能——根据EXTEND.md中的默认设置或环境中可用的API密钥选择提供商。当用户明确提及即梦 / Dreamina / Jimeng时,请勿使用此技能,此类请求应转至happy-dreamina。
这是使用正确的当前SDK(@google/genai v1.27+,而非已废弃的@google/generative-ai)的Google Gemini API完整指南。涵盖文本生成、多模态输入(文本+图片+视频+音频+PDF)、函数调用、思考模式、流式传输、系统指令,以及2025年的准确模型信息(Gemini 2.5 Pro/Flash/Flash-Lite,支持100万输入令牌,而非200万)。 适用场景:集成Gemini API、实现多模态AI应用、使用思考模式进行复杂推理、并行执行函数调用、流式响应、部署到Cloudflare Workers、构建聊天应用,或遇到SDK废弃警告、上下文窗口错误、模型未找到错误、函数调用失败、多模态格式错误时。
调用Google Gemini模型以实现结构化输出、多模态任务及谷歌专属功能。当用户需要使用Gemini、结构化JSON输出、Google API集成或高性价比并行处理时,可采用本方案。
通过scripts/目录下的脚本,使用Google Gemini和Imagen模型生成图片。可用于AI图片生成、文本转图片、根据提示词创建视觉内容、生成多张图片、自定义宽高比以及生成最高4K的高分辨率输出。触发词包括“generate image”“create image”“imagen”“text to image”“AI art”“nano banana”。
使用Google Gemini CLI执行大上下文代码分析、多模态推理以及仓库级代码评审。 也可用于委派需要100万token上下文窗口或Gemini专属功能的任务。
使用Google Gemini Deep Research Agent执行自主多步骤研究。适用于:市场分析、竞品格局分析、文献综述、技术调研、尽职调查。任务耗时2-10分钟,可生成带引用的详细报告,每次任务成本为2-5美元。
在使用Google Gemini进行开发时,查阅Gemini API文档、SDK模式以及当前最佳实践。将主题映射到本地缓存文档和在线源,提供正确的@google/genai使用模式,并突出已弃用API与当前API的使用差异。可通过‘gemini docs’、‘gemini guide’、‘how to use gemini’、‘gemini SDK’、‘@google/genai’触发,或者在编写导入@google/genai或google-genai的代码时触发。
通过scripts/目录下的脚本,使用Google Gemini TTS模型将文本转换为语音。可用于文本转语音、音频生成、语音合成、多角色对话以及创建音频内容。支持多种音色和流式输出。触发词包括"text to speech"、"TTS"、"generate audio"、"voice synthesis"、"speak this text"。
通过scripts/目录下的脚本使用Google Gemini模型生成文本内容。可用于文本生成、带图片的多模态提示词、复杂推理的思维模式、JSON格式输出,以及借助Google Search grounding获取实时信息。触发关键词包括“generate with gemini”、“use gemini for text”、“AI text generation”、“multimodal prompt”、“gemini thinking mode”、“grounded response”。
使用Google Gemini Omni Flash(`gemini-omni-flash-preview`)生成并以对话式方式编辑短视频。适用于以下场景:(1) 使用自然语言编辑迭代剪辑,而非重新生成(例如“让手机消失,其他内容保持不变”);(2) 生成带有合成音频、屏幕渲染文本或时间码节拍的3-10秒720p剪辑;(3) 通过<FIRST_FRAME>/<IMAGE_REF_N>提示标签将参考图像绑定到角色;(4) 编辑已上传的现有视频。可通过项目的GEMINI_API_KEY/GOOGLE_API_KEY访问`gemini_omni_video`工具——该密钥与Imagen和Google TTS通用。
基于Google Gemini的Nano Banana与Nano Banana Pro图像生成API构建全栈Web应用。适用于创建Next.js图像生成应用、文本转图像工具或迭代式图像编辑器。