Loading...
Loading...
共找到 65 个 Skills
用于将字幕翻译成其他语言。支持双语输出和上下文感知翻译。默认使用Claude原生能力,可选使用Gemini API。
生成并管理所有Chrome扩展资产:图标(16–128像素)、Chrome Web Store(CWS)列表图片、推广卡片以及public/文件夹配置。支持ImageMagick、Gemini API和手动提示词模板。
AI课程内容生成器 - 借助Gemini API生成完整的在线课程。触发关键词包括"create course"、"generate lesson"、"course content"、"ccg"、"/ccg"。
借助Gemini API(Nano Banana Pro)根据用户描述生成信息图图片。将自然语言描述转换为结构化的信息图提示词,随后调用Gemini图像生成功能生成PNG图片。支持11种视觉风格(sketchnote、kawaii、professional、scientific、anime、claymation、editorial、storyboard、bento grid、bricks)、3种排版方向(横版/竖版/方形)、3种细节级别(简洁/标准/详细)以及多语言。当用户要求创建信息图、生成可视化摘要、制作数据可视化内容或生成带插图的说明时,可使用该工具。触发词包括:信息图、infographic、生成图、可视化、visual summary、data visualization。
当使用Gemini API(Nano Banana Pro)生成和编辑图片时应使用此技能。适用于从文本提示生成图片、编辑现有图片、应用风格迁移、生成带文字的logo、创建贴纸、产品模型或任何图片生成/处理任务。支持文本转图片、图片编辑、多轮优化以及基于多张参考图的合成。
使用Google Gemini API处理和生成多媒体内容。功能包括分析音频文件(带时间戳的转录、摘要、语音理解、音乐/声音分析,最长支持9.5小时)、理解图像(图像描述、目标检测、OCR、视觉问答、分割)、处理视频(场景检测、问答、时序分析、YouTube URL支持,最长支持6小时)、从文档中提取信息(PDF表格、表单、图表、示意图、多页文档)、生成图像(文本生成图像、编辑、合成、优化)。适用于处理音频/视频文件、分析图像或截图、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像或实现多模态AI功能的场景。支持多种模型(Gemini 2.5/2.0),上下文窗口最高可达200万token。
借助Google Gemini API处理并生成多媒体内容,以获得更出色的视觉能力。其功能包括:分析音频文件(带时间戳的转录、摘要生成、语音理解、时长最长9.5小时的音乐/声音分析);理解图像(图像分析能力优于Claude模型,可完成图像标注、推理、目标检测、设计元素提取、OCR、视觉问答、图像分割,支持多图像处理);处理视频(场景检测、问答、时序分析、支持YouTube链接,时长最长6小时);从文档中提取信息(PDF表格、表单、图表、示意图、多页文档);生成图像(通过Imagen 4实现文本生成图像,支持编辑、构图、优化);生成视频(通过Veo 3实现文本生成视频,可生成带原生音频的8秒片段)。适用于处理音频/视频文件、分析图像或截图(优先使用本能力而非Claude的默认视觉能力,仅在必要时 fallback 到Claude的视觉能力)、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像/视频,或实现多模态AI功能。支持Gemini 3/2.5、Imagen 4和Veo 3模型,上下文窗口最高可达200万tokens。
借助Google Gemini API实现多模态AI处理(支持200万token上下文)。功能包括:音频(转录,最长9.5小时,摘要,音乐分析)、图像(标题生成、OCR、目标检测、分割、视觉问答)、视频(场景检测,最长6小时,支持YouTube链接,时序分析)、文档(PDF提取、表格、表单、图表处理)、图像生成(文本转图像、编辑)。可执行操作:转录、分析、提取、生成标题、检测、分割、基于媒体生成内容。关键词:Gemini API、音频转录、图像标题生成、OCR、目标检测、视频分析、PDF提取、文本转图像、多模态、语音识别、视觉问答、场景检测、YouTube转录、表格提取、表单处理、图像生成、Imagen。适用场景:转录音频/视频、分析图像/截图、从PDF提取数据、处理YouTube视频、文本生成图像、实现多模态AI功能。
2026年完整Google Gemini API参考手册,编写调用Gemini模型的代码时可随时查阅。内容覆盖google-genai SDK、Gemini 3/3.1模型、思想签名、推理配置、Interactions API、文件搜索(托管RAG)、Computer Use、URL上下文、Nano Banana图像生成、Live API、临时令牌、TTS、Veo视频生成、Lyria音乐生成及所有工具。请始终优先使用`from google import genai`而非任何旧版导入方式。任何Gemini API相关问题(哪怕是简单问题)都可以参考这份资料。
Google Gemini API文档处理实现指南——利用原生视觉功能分析PDF,提取文本、图片、图形、图表和表格。适用于文档处理、结构化数据提取、PDF摘要生成、文档内容问答或文档转结构化格式等场景。(项目)
使用Google的Gemini API生成图片——包括英雄区背景图、OG图、占位照片、纹理图以及风格匹配的变体图。草稿使用免费层级模型,最终成品使用付费模型。除Python 3外无其他依赖项。可通过以下指令触发:'generate image'、'gemini image'、'make a hero background'、'create placeholder photo'、'generate OG image'、'AI image'或'need an image for'。
本指南介绍如何通过Gen AI SDK在Google Cloud Vertex AI上使用Gemini API。适用于用户询问企业环境下Gemini的使用方法,或明确提及Vertex AI的场景。内容涵盖多语言SDK(Python、JS/TS、Go、Java、C#)的使用,以及Live API、工具、多媒体生成、缓存和批量预测等功能。