Loading...
Loading...
共找到 112 个 Skills
一款通用AI语音/文本转语音Skill,支持OpenAI TTS(gpt-4o-mini-tts、tts-1)、具备语音克隆功能的ElevenLabs多语言TTS、百炼Qwen TTS(qwen-tts/qwen3-tts-vd支持自定义语音设计,内置长文本分段功能)、MiniMax speech-02-hd、SiliconFlow CosyVoice/SenseVoice以及PlayHT 2.0。当用户要求朗读文本、合成语音、生成旁白、制作配音、为脚本配声或将任意文本转换为音频(mp3/wav/ogg/flac)时,均可使用本Skill。典型请求语句包括“read this aloud”“generate voice for...”“create a narration of...”“tts this”“把这段念出来”“做个配音”“合成语音”,或是提及Alloy、Ash、Cherry、Rachel、CosyVoice、PlayHT等语音/TTS模型名称。即便用户未指定服务商,也需使用本Skill——从EXTEND.md的默认配置或可用环境变量中选择一个服务商即可。
MiniMax AI 的命令行界面——通过 MiniMax API 实现聊天(MiniMax-M2.7)与文本转语音(speech-2.8-hd)功能。
借助ElevenLabs Text-to-Speech API生成逼真的音频。适用于用户需要将文本转换为语音、制作配音、生成旁白或制作音频内容的场景。触发词包括“生成音频”、“文本转语音”、“TTS”、“配音”、“旁白”、“ElevenLabs”、“从文本生成音频”、“朗读这段文本”
通过WebSocket使用Azure OpenAI的GPT Realtime Mini模型生成由AI驱动的播客风格音频叙事。适用于构建文本转语音功能、音频叙事生成、播客创作等场景。
播放音频文件、使用文本转语音功能以及通话录音,可用于构建IVR系统、播放通知或录制对话。本技能提供Go SDK示例。
通过scripts/目录下的脚本,使用Google Gemini TTS模型将文本转换为语音。可用于文本转语音、音频生成、语音合成、多角色对话以及创建音频内容。支持多种音色和流式输出。触发词包括"text to speech"、"TTS"、"generate audio"、"voice synthesis"、"speak this text"。
使用OpenRouter的文本转语音(TTS)API从文本生成语音音频。当用户要求合成语音、为文本添加旁白、制作配音、生成有声书片段、朗读文本、将文本转换为音频文件,或者提到TTS、text-to-speech、语音合成时,可使用此工具。
通过Google Cloud Text-to-Speech API实现文本转语音合成——支持MP3输出、可配置语言与语音、语音列表功能。
使用Qwen3-TTS构建文本转语音应用,这是一个功能强大的语音生成系统,支持语音克隆、语音设计和自定义语音合成。适用于创建TTS应用、将文本转换为语音、从音频样本克隆语音、通过自然语言描述设计新语音或微调TTS模型的场景。支持10种语言(中文、英文、日文、韩文、德文、法文、俄文、葡萄牙文、西班牙文、意大利文)。
基于Edge/Doubao/CosyVoice/Azure/腾讯/百度/MiniMax/讯飞,以及ElevenLabs/OpenAI/Google的多平台中文及多语言TTS文本转语音工具——支持11种后端服务、词级时间戳、[PAUSE:x]停顿标记、拼音发音修正
DashScope(阿里云百炼)集成——包含图像生成(qwen-image-2.0-pro)、文本转语音(qwen3-tts-flash)以及带词级时间戳的自动语音识别(qwen3-asr-flash-filetrans)。适用于通过Qwen-Image生成图像、通过Qwen-TTS生成旁白,或通过Qwen-ASR生成带词级时间戳的转录内容的场景。
可被Agent调用的ElevenLabs工具——将文本转换为语音音频、创建音效和多角色对话、重新配音并清理音频、转录音频和视频、设计合成语音,以及管理语音、生成历史和配额。当用户提及ElevenLabs或需要AI音频相关工作时使用——包括文本转语音、旁白、配音、转录、变声或音效设计——即使用户没有明确提到ElevenLabs,例如“把这段内容读出来”“把这个做成MP3”“转录这段录音”。