Loading...
Loading...
共找到 63 个 Skills
使用Google Gemini的Nano Banana Pro(gemini-3-pro-image-preview)模型进行图像生成与编辑。 当用户提出以下请求时使用:“生成图片”、“创建图片”、“帮我做一张图”、“绘制”、 “编辑那张图片”、“更改颜色”、“移除背景”、“添加透明度”、“修改这张图片”、 “使其透明”、“更改风格”、“给图片添加文字”,或任何图像创建/处理任务。 支持文本转图像生成、图像编辑、多轮对话,以及通过差异抠图技术提取透明度。
2026年完整Google Gemini API参考手册,编写调用Gemini模型的代码时可随时查阅。内容覆盖google-genai SDK、Gemini 3/3.1模型、思想签名、推理配置、Interactions API、文件搜索(托管RAG)、Computer Use、URL上下文、Nano Banana图像生成、Live API、临时令牌、TTS、Veo视频生成、Lyria音乐生成及所有工具。请始终优先使用`from google import genai`而非任何旧版导入方式。任何Gemini API相关问题(哪怕是简单问题)都可以参考这份资料。
基于AI的渗透测试自动化CLI工具,借助Google Gemini、Claude或GPT-4与LangChain实现智能安全评估
面向Google Gemini和Antigravity模型的终端AI Agent CLI工具,支持斜杠命令、MCP服务器集成及编码辅助功能
使用ModelsLab兼容OpenAI的Chat Completions API与大语言模型(LLM)对话。支持60余种模型,包括DeepSeek R1、Meta Llama、Google Gemini、Qwen和Mistral,同时支持流式响应、函数调用和结构化输出。
借助Google Gemini API处理并生成多媒体内容,以获得更出色的视觉能力。其功能包括:分析音频文件(带时间戳的转录、摘要生成、语音理解、时长最长9.5小时的音乐/声音分析);理解图像(图像分析能力优于Claude模型,可完成图像标注、推理、目标检测、设计元素提取、OCR、视觉问答、图像分割,支持多图像处理);处理视频(场景检测、问答、时序分析、支持YouTube链接,时长最长6小时);从文档中提取信息(PDF表格、表单、图表、示意图、多页文档);生成图像(通过Imagen 4实现文本生成图像,支持编辑、构图、优化);生成视频(通过Veo 3实现文本生成视频,可生成带原生音频的8秒片段)。适用于处理音频/视频文件、分析图像或截图(优先使用本能力而非Claude的默认视觉能力,仅在必要时 fallback 到Claude的视觉能力)、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像/视频,或实现多模态AI功能。支持Gemini 3/2.5、Imagen 4和Veo 3模型,上下文窗口最高可达200万tokens。
借助Google Gemini API实现多模态AI处理(支持200万token上下文)。功能包括:音频(转录,最长9.5小时,摘要,音乐分析)、图像(标题生成、OCR、目标检测、分割、视觉问答)、视频(场景检测,最长6小时,支持YouTube链接,时序分析)、文档(PDF提取、表格、表单、图表处理)、图像生成(文本转图像、编辑)。可执行操作:转录、分析、提取、生成标题、检测、分割、基于媒体生成内容。关键词:Gemini API、音频转录、图像标题生成、OCR、目标检测、视频分析、PDF提取、文本转图像、多模态、语音识别、视觉问答、场景检测、YouTube转录、表格提取、表单处理、图像生成、Imagen。适用场景:转录音频/视频、分析图像/截图、从PDF提取数据、处理YouTube视频、文本生成图像、实现多模态AI功能。
使用Google Gemini Nano Banana图像生成API(gemini-2.5-flash-image、gemini-3-pro-image-preview)构建Next.js Web应用。适用于创建图像生成器、编辑器、图库,或任何将对话式图像生成与服务器操作、API路由和存储集成的应用场景。可用于「图像生成应用」「Nano Banana」「文本转图像」「AI图像生成器」或「Gemini图像」相关场景。请勿用于非Gemini模型、Python/Go后端、模型微调或图像分类/输入任务。
MassGen 中的图像生成与编辑指南,适用于创建图像、编辑已有图像、迭代图像设计,或者在不同图像后端(OpenAI、Google Gemini/Imagen、Grok、OpenRouter)之间做选择的场景。
由Google Gemini驱动的AI图像生成Skill,可无缝创建UI占位图、文档素材和设计资产。
当用户想要使用Google Gemini进行分析、处理大文件或代码库、沙箱执行或头脑风暴时使用。使用无头Gemini CLI脚本(无MCP)。触发关键词为"use Gemini"、"analyze with Gemini"、"large file"、"sandbox"、"brainstorm with Gemini"。
当用户希望调用Google Gemini CLI执行推理任务、研究工作及AI辅助操作时使用。触发短语包括:"use gemini"、"ask gemini"、"run gemini"、"call gemini"、"gemini cli"、"Google AI"、"Gemini reasoning",或者当用户请求使用Google的AI模型、进行带网页搜索的研究,或是希望继续之前的Gemini会话时也可触发。