Loading...
Loading...
共找到 112 个 Skills
利用Google GenAI及Cloud Speech SDK实现语音生成(TTS)、语音转文字(STT)和语音克隆功能,支持Gemini-TTS、Chirp 3以及Instant Custom Voice。
Voicebox专属进阶技能——基于Tauri、React和FastAPI构建的开源本地语音克隆与TTS工作室
使用Google Gemini TTS生成博客文章的音频旁白。支持摘要旁白、全文朗读以及拥有30种语音选项的双主播播客/对话模式。输出MP3文件及HTML5音频嵌入代码。可通过`/blog audio`独立运行,也可在blog-write内部调用。未配置API密钥时会优雅降级。当用户说出“blog audio”“narrate blog”“audio version”“text to speech”“tts”“podcast mode”“read aloud”“audio narration”“voice”“narration”“generate audio”时可触发该功能。
借助OpenAI API的内置语音功能,将文本转换为语音音频。适用于旁白解说、讲座音频和快速配音音轨制作。
Uberduck集成,可管理数据、记录并自动化工作流,适用于用户需要与Uberduck数据交互的场景。
当用户要求根据文本内容生成、创建或制作播客时,可使用此Skill。它能将书面内容转换为双主播对话式的播客音频格式,对话自然流畅。
Deepgram集成,可管理项目,适用于用户需要与Deepgram数据交互的场景。
将文本文件通过 MiniMax TTS API 生成中文口播音频,自动处理多音字、英文缩写、 混合模型名、数字读法等高频发音错误。当用户说"使用MiniMax生成口播音频"时触发。
ElevenLabs 集成。可管理数据、记录,实现工作流自动化。适用于用户需要与ElevenLabs数据交互的场景。
将文本合成为语音(TTS)。使用火山引擎豆包语音合成 API,支持流式合成、多种音色、语速/音调/音量调节、Markdown 过滤和 LaTeX 公式播报。当用户需要把文字转成语音、生成朗读音频、配音、旁白、播报,或提到「文字转语音」「TTS」「语音合成」「朗读」「配音」时使用本技能。
使用ElevenLabs API将文本转换为语音。当你需要为消息、旁白或无障碍功能生成语音音频时使用。
用于视频旁白的ElevenLabs TTS集成方案。适用于生成旁白音频、选择语音或构建脚本转音频流水线场景