Loading...
Loading...
共找到 112 个 Skills
在HyperFrames HTML中创建视频合成、动画、标题卡、叠加层、字幕、旁白、音频响应视觉效果及场景过渡。当需要构建任何基于HTML的视频内容、添加与音频同步的字幕或副标题、生成文本转语音旁白、创建音频响应动画(节拍同步、发光、音乐驱动的脉冲效果)、添加动画文本高亮(标记扫过、手绘圆圈、爆发线条、涂鸦、草图效果)或添加场景间过渡(淡入淡出、擦除、揭示、着色器过渡)时,均可使用本技能。内容涵盖合成创作、时间控制、媒体处理及完整的视频制作工作流。有关CLI命令(init、lint、preview、render、transcribe、tts),请查看hyperframes-cli技能。
适用于Azure AI的以下场景:Search、Speech、OpenAI、Document Intelligence。可用于搜索、向量/混合搜索、语音转文本、文本转语音、转录、OCR识别。适用场景包括:AI Search、查询搜索、向量搜索、混合搜索、语义搜索、语音转文本、文本转语音、转录、OCR识别、文本转语音转换。不适用场景:函数应用/Functions(请使用azure-functions)、数据库(azure-postgres/azure-kusto)、通用Azure资源。
Novita AI:涵盖大语言模型(LLM)、图像生成与编辑、视频生成、音频(TTS/ASR)以及GPU云服务。当用户需要调用Novita AI API时即可使用本技能——包括与LLM(DeepSeek、Llama、Qwen)对话、生成图像(FLUX、Stable Diffusion、Seedream、混元图像)、编辑图像(移除背景、图像放大、图像修复、图生图、扩图、重绘、人脸融合、替换背景、移除文字)、生成视频(Kling、Wan、混元、Minimax Hailuo、Vidu、PixVerse、Seedance)、进行文本转语音或语音转文本(MiniMax TTS、GLM TTS、Fish Audio、ASR、语音克隆)、运行兼容OpenAI的批量任务、管理GPU云实例与无服务器端点,或查询账户余额与账单。当用户提及novita.ai、Novita AI、Novita API密钥,或想要使用任何Novita平台服务时也会触发本技能——即使用户只说“生成一张图片”或“运行LLM”且Novita作为可用提供商时也会触发。
通过Sapiom为AI Agent访问各类付费服务(验证、搜索、AI模型、图片、音频、浏览器自动化)。在构建需要验证手机号/邮箱、网页搜索、调用AI模型、生成图片、文本转语音或自动化浏览器的Agent时使用——无需设置供应商账户。
通过curl调用OpenAI API。可使用该技能实现GPT对话补全、DALL-E图像生成、Whisper音频转写、文本嵌入以及文本转语音功能。
MiniMax多模态模型技能——使用MiniMax多模态模型处理语音、音乐、视频和图像。借助MiniMax AI创建语音、音乐、视频和图像:TTS(文本转语音、语音克隆、语音设计、多片段)、音乐(歌曲、纯音乐)、视频(文本转视频、图像转视频、首尾帧、主体参考、模板、多场景长视频)、图像(文本转图像、带人物参考的图像转图像),以及媒体处理(格式转换、拼接、裁剪、提取)。当用户提及MiniMax、多模态生成,或需要语音/音乐/视频/图像AI、MiniMax API,或结合MiniMax输出的FFmpeg工作流时使用。
借助TTS(文本转语音)自动播报计划、问题及总结内容。在完成敲定计划、解决问题或生成总结等重要任务后,可主动使用该技能。每个项目配备专属语音,用户在其他房间也能分辨是哪个项目的播报内容。当遇到速率限制时,将按顺序(google、openai、elevenlabs、say)切换备用服务商。
通过RunningHub API(170+个接口)生成图片、视频、音频和3D模型,还能通过webappId运行任意RunningHub AI应用(自定义ComfyUI工作流)。支持文本生成图片、图片生成视频、文本转语音、音乐生成、3D建模、图片超分辨率、AI应用等多种功能。
使用React、JavaScript、React Native或Swift SDK,基于ElevenLabs平台构建对话式AI语音代理。 配置代理、工具(客户端/服务器/MCP)、RAG知识库、多语音以及Scribe实时语音转文本(STT)功能。 适用场景:构建语音聊天界面、通过Twilio实现AI电话代理、配置代理工作流或工具、添加RAG知识库、使用CLI以“代理即代码”方式测试,或排查已弃用的@11labs包、Android音频截断、CSP违规、动态变量或WebRTC配置问题。 关键词:ElevenLabs Agents、ElevenLabs语音代理、AI语音代理、对话式AI、@elevenlabs/react、@elevenlabs/client、@elevenlabs/react-native、@elevenlabs/elevenlabs-js、@elevenlabs/agents-cli、ElevenLabs SDK、语音AI、TTS(文本转语音)、ASR(语音识别)、轮次对话模型、WebRTC语音、WebSocket语音、ElevenLabs对话、代理系统提示词、代理工具、代理知识库、RAG语音代理、多语音代理、发音词典、语音速度控制、ElevenLabs Scribe、@11labs弃用、Android音频截断、ElevenLabs CSP违规、ElevenLabs动态变量、大小写敏感工具名称、Webhook认证
使用Runway API生成AI视频、图像与音频。适用于通过Runway进行图生视频、文本生视频、视频转视频、角色动作生成、文本生图像、文本转语音、音效生成或语音处理等场景。
使用Google的Gemini-TTS和Chirp 3模型生成并转录语音。支持文本转语音(单/多发言人)、即时自定义语音,以及语音转文本(转录/说话人分离)。
基于AI的音频生成综合方案,涵盖文本转音乐、语音合成、文本转语音(TTS)、音效生成及音频处理,可使用MusicGen、Bark、ElevenLabs等工具。当提及「音乐生成、文本转音乐、AI音乐、语音克隆、文本转语音、TTS API、ElevenLabs、MusicGen、Bark、音频合成、音效生成、语音合成、AudioCraft」相关内容时适用。