Loading...
Loading...
共找到 25 个 Skills
当处理用于自然语言处理、计算机视觉、音频或多模态任务的预训练Transformer模型时,应使用此技能。可用于文本生成、分类、问答、翻译、摘要、图像分类、目标检测、语音识别以及在自定义数据集上微调模型等场景。
借助Google Gemini API实现多模态AI处理(支持200万token上下文)。功能包括:音频(转录,最长9.5小时,摘要,音乐分析)、图像(标题生成、OCR、目标检测、分割、视觉问答)、视频(场景检测,最长6小时,支持YouTube链接,时序分析)、文档(PDF提取、表格、表单、图表处理)、图像生成(文本转图像、编辑)。可执行操作:转录、分析、提取、生成标题、检测、分割、基于媒体生成内容。关键词:Gemini API、音频转录、图像标题生成、OCR、目标检测、视频分析、PDF提取、文本转图像、多模态、语音识别、视觉问答、场景检测、YouTube转录、表格提取、表单处理、图像生成、Imagen。适用场景:转录音频/视频、分析图像/截图、从PDF提取数据、处理YouTube视频、文本生成图像、实现多模态AI功能。
借助阿里云Model Studio Qwen VL模型(qwen3-vl-plus/qwen3-vl-flash及最新别名)实现图像理解。适用于构建图像问答、视觉分析、类OCR提取、图表识别或截图理解等工作流场景。
使用Transformers.js直接在JavaScript/TypeScript中运行最先进的机器学习模型。支持自然语言处理(文本分类、翻译、摘要)、计算机视觉(图像分类、目标检测)、音频(语音识别、音频分类)以及多模态任务。可在Node.js和浏览器(基于WebGPU/WASM)环境中运行,使用来自Hugging Face Hub的预训练模型。
分析视频、屏幕录制内容和截图,为 coding Agent 生成结构化、可执行的笔记。支持 Loom、YouTube 和本地文件。可提取视觉上下文、屏幕显示文本和音频旁白。当有人分享视频而你需要理解其内容时即可使用。
这是使用正确的当前SDK(@google/genai v1.27+,而非已废弃的@google/generative-ai)的Google Gemini API完整指南。涵盖文本生成、多模态输入(文本+图片+视频+音频+PDF)、函数调用、思考模式、流式传输、系统指令,以及2025年的准确模型信息(Gemini 2.5 Pro/Flash/Flash-Lite,支持100万输入令牌,而非200万)。 适用场景:集成Gemini API、实现多模态AI应用、使用思考模式进行复杂推理、并行执行函数调用、流式响应、部署到Cloudflare Workers、构建聊天应用,或遇到SDK废弃警告、上下文窗口错误、模型未找到错误、函数调用失败、多模态格式错误时。
一款多模态ComfyUI技能,可通过单一、统一的Midjourney风格提示词模板,生成90年代末/2000年初复古动漫风格的角色、电影帧、图像、音效及语音。
通过OpenRouter的异步视频生成API,根据文本提示(以及可选的参考图或帧图像)生成视频。当用户要求根据描述创建、生成视频或动画,为现有图像添加动画效果,或将提示转换为短视频片段时使用。
当需要使用阿里云Model Studio QVQ模型进行视觉推理时使用,包括分步图像推理、图表分析和基于视觉的问题解决。
基于@google/genai SDK的Google Gemini API指南。适用于多模态AI、思维模式、函数调用场景,或解决SDK弃用警告、上下文错误、多模态格式错误等问题。
连接冻结图像编码器与大语言模型(LLMs)的视觉-语言预训练框架。当你需要图像标题生成、视觉问答、图文检索或具备最先进零样本性能的多模态对话时,可使用本框架。
Cosmos-Embed1 是用于text-to-video retrieval、video-to-video search、语义去重和微调的视频-文本嵌入模型。当用户请求「微调Cosmos-Embed1」、「运行cosmos-embed推理」、「导出Cosmos-Embed1」、「嵌入视频」或「用文本搜索视频」时使用本技能。