Loading...
Loading...
共找到 112 个 Skills
使用ModelsLab的v7 Voice API生成语音、音乐和音效。通过ElevenLabs和Inworld模型支持文本转语音、语音转文本、语音转语音、音乐生成、音效制作、配音、歌曲扩展以及歌曲补全功能。
MassGen 中的音频生成与理解指南,涵盖基于 ElevenLabs 和 OpenAI 后端的文本转语音、音乐生成、音效生成以及音频理解能力。
当用户需要生成语音、旁白或文本转音频时使用。通过Giggle.pro TTS API将文本转换为AI语音。触发词:生成语音、文本转语音、TTS、旁白、朗读这段文本、合成语音。
[QwenCloud] 使用Qwen TTS模型将文本合成为语音。触发场景:用户想要将文本转语音、创建配音、生成音频旁白、朗读文本、构建TTS应用,提及语音合成/语音生成/文本转音频输出,或显式按名称调用此技能(例如使用qwencloud-audio-tts)。禁止触发场景:用户想要语音识别/ASR、无音频的文本生成、非Qwen的音频任务。
使用StepFun的stepaudio-2.5-tts生成中文/日文语音——这是一款上下文感知型TTS,它用自然语言格式的`instruction`(≤200字符)加上内嵌的`()`括号来控制句内韵律,取代了step-tts-2中的`voice_label`。当用户需要对语音合成进行情绪/韵律控制(如耳语、停顿、重音、句中情绪转折)、批量生成游戏/应用语音台词、从`step-tts-2`迁移(存在`voice_label`转为`instruction`的破坏性变更),或是遇到StepFun 2.5版本更严格的内容审核(包含“死”“消失”或政治敏感词汇)时,均可使用本工具。触发关键词包括:阶跃TTS、StepAudio合成、语音合成、配音、文本转语音、TTS升级、迁移step-tts-2。如需使用同系列的stepaudio-2.5-asr模型进行语音转文本,请改用stepfun-asr技能。
借助Model Studio DashScope Qwen TTS(qwen3-tts-flash)生成类人语音音频。适用于文本转语音、为短剧/新闻视频制作语音台词,或是为DashScope编写TTS请求/响应字段文档的场景。
使用ElevenLabs文本转语音功能将文档和文本转换为音频。 当用户想要创建播客、朗读文档、将文本大声读出、从文件生成音频或进行文本转语音时,可使用此技能。
基于Doubao(火山引擎)API的文本转语音(TTS)工具。适用于将文本转换为自然语音、从文本生成音频文件、查看可用TTS音色,以及合成可自定义语速/音量参数的语音场景。
借助Google Cloud Text-to-Speech将文档和文本转换为音频。 当用户需要以下操作时可使用该技能:朗读文档、朗读文本、从文件生成音频、将文本转换为语音、创建文档或分析内容的录音、从文档制作播客,或使用Google TTS/文本转语音功能。触发短语:“把这个读出来”、“朗读这个”、“创建录音”、“文本转语音”、“TTS”、“转换为音频”、“从文档生成音频”、“听这个”、“生成音频”、“google tts”、“制作播客”。
通过Venice.ai实现的文本转语音模型、语音、格式及流处理功能。适用于旁白、配音以及对话Agent语音场景。
Deepgram API参考文档,涵盖语音转文本(STT)、文本转语音(TTS)、语音代理、音频智能以及账户管理功能。适用于基于Deepgram REST或WebSocket API的开发场景,包含认证方式、所有端点、查询参数、请求/响应模式以及WebSocket消息格式等内容。参考文档按领域划分:listen(语音转文本)、speak(文本转语音)、agent(语音代理)、read(文本/音频智能)、模型、项目、认证以及自托管。
完整的ElevenLabs AI音频平台:包含文本转语音(TTS)、语音转文本(STT/Scribe)、语音克隆、语音设计、音效生成、音乐生成、配音、变声、人声分离以及对话式语音Agent。适用于音频生成、语音合成、转录、音频处理或构建语音交互应用场景。触发项:生成语音、克隆语音、音频转录、创建音效、创作音乐、视频配音、变声、分离人声、构建语音Agent、ElevenLabs API/SDK/CLI/MCP。