Loading...
Loading...
共找到 35 个 Skills
基于AI的音频生成综合方案,涵盖文本转音乐、语音合成、文本转语音(TTS)、音效生成及音频处理,可使用MusicGen、Bark、ElevenLabs等工具。当提及「音乐生成、文本转音乐、AI音乐、语音克隆、文本转语音、TTS API、ElevenLabs、MusicGen、Bark、音频合成、音效生成、语音合成、AudioCraft」相关内容时适用。
在Ubuntu上使用带回退方案的Kokoro TTS实现本地文本转语音。当用户要求朗读文本、测试音频输出、切换Kokoro语音或调试TTS播放问题时使用。触发关键词包括“朗读这段内容”、“大声读出来”、“说话”、“TTS”、“语音测试”。
Amazon Polly集成。管理数据、记录并自动化工作流。当用户需要与Amazon Polly数据交互时使用。
借助OpenAI API的内置语音功能,将文本转换为语音音频。适用于旁白解说、讲座音频和快速配音音轨制作。
该技能借助ElevenLabs API将文本转换为高质量音频文件。当用户需要生成文本转语音、音频旁白或语音合成,且需要自定义语音参数(稳定性、相似度增强)和使用预设语音(rachel、adam、bella、elli、josh、arnold、ava)时,可使用此技能。
使用edge-tts或macOS say实现文本转语音。当用户说出“speak”“say”“read aloud”或需要朗读文本时使用。
具备Mac风格say交互体验的ElevenLabs文本转语音工具
[QianWen] 借助Qwen TTS模型将文本转换为语音。触发场景:用户需要将文本转语音、制作旁白、生成音频解说、朗读文本、构建TTS应用,提及语音合成/语音生成/文本转音频输出,或明确通过名称调用此技能(例如:use qianwen-audio-tts)。不触发场景:用户需要语音识别/ASR、无需音频的文本生成、非Qwen相关的音频任务。
临床ASR飞轮第一阶段。用于启动循环时:NVCF+MW披露、NVIDIA_API_KEY检查、依赖项安装、TTS+ASR冒烟测试。
通过OpenAI TTS API实现低延迟流式文本转语音——自适应句子分块、并发请求流水线、六种语音选项。
通过集成ElevenLabs,精通语音合成、TTS、语音克隆、播客制作、语音处理及语音UI设计。专注于语音清晰度、响度标准(LUFS)、去齿音、对话混音和语音转换。可通过以下关键词激活:'TTS'、'text-to-speech'、'voice clone'、'voice synthesis'、'ElevenLabs'、'podcast'、'voice recording'、'speech-to-speech'、'voice UI'、'audiobook'、'dialogue'。不适用于空间音频(请使用sound-engineer)、音乐制作(请使用DAW工具)、游戏音频中间件(请使用sound-engineer)、音效生成(请使用带ElevenLabs SFX的sound-engineer)或现场音乐会音频场景。
通过Together AI实现文本转语音(TTS)和语音转文本(STT)能力。TTS模型包括Orpheus、Kokoro、Cartesia Sonic、Rime、MiniMax,支持REST、流式传输和WebSocket。STT模型包括Whisper和Voxtral。适用于用户需要语音合成、音频生成、语音识别、转写、TTS、STT或实时语音应用的场景。