Loading...
Loading...
共找到 16 个 Skills
咨询外部AI(Gemini 2.5 Pro、OpenAI Codex、Claude)获取第二意见,可用于调试故障、架构决策、安全验证,或是需要综合分析的全新视角场景。
使用Google Gemini API处理和生成多媒体内容。功能包括分析音频文件(带时间戳的转录、摘要、语音理解、音乐/声音分析,最长支持9.5小时)、理解图像(图像描述、目标检测、OCR、视觉问答、分割)、处理视频(场景检测、问答、时序分析、YouTube URL支持,最长支持6小时)、从文档中提取信息(PDF表格、表单、图表、示意图、多页文档)、生成图像(文本生成图像、编辑、合成、优化)。适用于处理音频/视频文件、分析图像或截图、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像或实现多模态AI功能的场景。支持多种模型(Gemini 2.5/2.0),上下文窗口最高可达200万token。
这是使用正确的当前SDK(@google/genai v1.27+,而非已废弃的@google/generative-ai)的Google Gemini API完整指南。涵盖文本生成、多模态输入(文本+图片+视频+音频+PDF)、函数调用、思考模式、流式传输、系统指令,以及2025年的准确模型信息(Gemini 2.5 Pro/Flash/Flash-Lite,支持100万输入令牌,而非200万)。 适用场景:集成Gemini API、实现多模态AI应用、使用思考模式进行复杂推理、并行执行函数调用、流式响应、部署到Cloudflare Workers、构建聊天应用,或遇到SDK废弃警告、上下文窗口错误、模型未找到错误、函数调用失败、多模态格式错误时。
使用Gemini 2.5 Flash Image和Gemini 3 Pro Image(Nano Banana)生成和编辑高质量图像。支持文本生成图像、风格迁移、虚拟试穿和角色一致性功能。