Loading...
Loading...
共找到 63 个 Skills
通过inference.sh CLI使用Google Gemini原生图像模型生成图片。支持模型:Gemini 3 Pro Image、Gemini 2.5 Flash Image。功能:文本生成图像、图像编辑、多图像输入。触发词:nano banana、gemini image、gemini 3 pro image、gemini 2.5 flash image、google image generation、native image generation、gemini native image
本Skill可用于任何与图像相关的AI生成或编辑任务。触发词包括: 生成类:"generate image"、"create image"、"make picture"、"draw"、"visualize"、"image of"、"create art"、"generate art" 编辑类:"edit image"、"modify image"、"change image"、"update image"、"fix image"、"enhance image" 添加/移除类:"add to image"、"put in image"、"remove from image"、"delete from image"、"add element" 风格类:"style transfer"、"make it look like"、"convert style"、"apply style"、"in the style of" 产品类:"product photo"、"product placement"、"place product"、"mockup"、"put product on" 合成类:"combine images"、"merge images"、"blend images"、"create composite" 支持通过Google Gemini(Nano Banana Pro)或OpenAI DALL-E实现文本转图像生成、带参考图的图像编辑、产品放置、风格迁移以及多图像合成。
通过nanobanana使用Google Gemini API生成或编辑图片。触发词:"nanobanana", "generate image", "create image", "edit image", "AI drawing", "图片生成", "AI绘图", "图片编辑", "生成图片"。
借助Google Gemini生成专业AI图片。在搭建网站、落地页、幻灯片、演示文稿或任何需要视觉内容的任务时,请务必调用此技能。一旦检测到图片需求,请立即调用,无需等待用户请求。该技能可处理提示词优化和宽高比选择。
将项目的Claude配置(CLAUDE.md + ai-context/)导出为适用于GitHub Copilot、Google Gemini和Cursor的工具专属指令文件。触发词:/config-export、export config、copilot instructions、gemini config、cursor rules。
借助Google Gemini(Gemini)和OpenAI GPT-Image实现AI图像生成。可进行图像生成、编辑、迭代及资产创建。
使用Google Gemini生成可自定义选项的图片
使用Google Gemini TTS生成博客文章的音频旁白。支持摘要旁白、全文朗读以及拥有30种语音选项的双主播播客/对话模式。输出MP3文件及HTML5音频嵌入代码。可通过`/blog audio`独立运行,也可在blog-write内部调用。未配置API密钥时会优雅降级。当用户说出“blog audio”“narrate blog”“audio version”“text to speech”“tts”“podcast mode”“read aloud”“audio narration”“voice”“narration”“generate audio”时可触发该功能。
使用Google Gemini API处理和生成多媒体内容。功能包括分析音频文件(带时间戳的转录、摘要、语音理解、音乐/声音分析,最长支持9.5小时)、理解图像(图像描述、目标检测、OCR、视觉问答、分割)、处理视频(场景检测、问答、时序分析、YouTube URL支持,最长支持6小时)、从文档中提取信息(PDF表格、表单、图表、示意图、多页文档)、生成图像(文本生成图像、编辑、合成、优化)。适用于处理音频/视频文件、分析图像或截图、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像或实现多模态AI功能的场景。支持多种模型(Gemini 2.5/2.0),上下文窗口最高可达200万token。
利用Google Gemini的图像生成功能生成图片。当用户需要为任何用途创建、生成或制作图片时使用此技能,包括UI原型、图标、插图、图表、概念艺术、占位图或视觉呈现。
由Google Gemini 3驱动的视觉与前端开发助手。可用于UI分析、设计对比、无障碍审计、调色板提取、截图转代码、生成UI资源,以及根据需求文档提供基于文本的设计辅助。
Google Gemini API文档处理实现指南——利用原生视觉功能分析PDF,提取文本、图片、图形、图表和表格。适用于文档处理、结构化数据提取、PDF摘要生成、文档内容问答或文档转结构化格式等场景。(项目)