Loading...
Loading...
共找到 35 个 Skills
为向后兼容而保留的已废弃旧版TalkToMePy TTS Skill。建议使用[gaelic-ghost/a11y-skills](https://github.com/gaelic-ghost/a11y-skills)中的后续语音工作流。
文本转语音与语音旁白功能。触发指令包括:“朗读这段”、“配音”、“TTS”、“语音合成”、“text to speech”、“read this aloud”、“convert to speech”、“voice narration”、“read aloud”。
基于ElevenLabs和系统语音的文本转语音合成
借助Model Studio DashScope Qwen TTS(qwen3-tts-flash)生成类人语音音频。适用于文本转语音、为短剧/新闻视频制作语音台词,或是为DashScope编写TTS请求/响应字段文档的场景。
使用ElevenLabs Dubbing API(dubbing_v2)将音视频配制成其他语言,同时保留原说话人的音色。适用于将视频、播客或录音翻译成其他语言、本地化媒体内容、审核或修正配音文稿与译文、以及编辑后重新生成配音的场景。
使用阿里云DashScope API和LingMou生成AI视频与语音。具备七大功能——(1) LivePortrait数字人分身(图片+音频→视频,两步流程),(2) EMO数字人分身,(3) AA/AnimateAnyone全身动画(三步流程),(4) T2I文本生成图片(万相2.x,默认模型wan2.2-t2i-flash),(5) I2V图片生成视频(万相2.x,默认模型wan2.7-i2v-flash,支持T2I→I2V流水线),(6) Qwen TTS语音合成(根据场景自动选择模型/音色,默认模型qwen3-tts-vd-realtime-2026-01-15),(7) LingMou数字人模板视频,支持随机模板、公共模板复制及脚本确认。适用于用户需要数字人分身、肖像动画、全身动画、文本转图片、文本转视频或语音合成的场景。
使用OpenRouter的文本转语音(TTS)API从文本生成语音音频。当用户要求合成语音、为文本添加旁白、制作配音、生成有声书片段、朗读文本、将文本转换为音频文件,或者提到TTS、text-to-speech、语音合成时,可使用此工具。
默认使用Azure TTS,或在配置后使用Gemini 3.1 Flash TTS,为视频生成音画同步的专业旁白配音。当用户想要为任何视频文件添加旁白、配音、解说或语音配音时,即可使用此技能——即使用户仅说“给这个视频加音频”或“制作带旁白的版本”。当用户有需要添加音轨的屏幕录制、演示、教程或演示视频时,也会触发此技能。触发条件包括用户提出中文请求,如“视频配音”、“给视频加旁白”、“录屏解说”、“视频加语音”、“视频添加声音”、“生成视频旁白”、“自动配音”、“视频解说词”。
使用 ListenHub API 将文本转换为语音(TTS)。支持三种模式:快速合成(/v1/tts)、 多角色脚本(/v1/speech)、长文本流式合成(/v1/flow-speech/episodes)。 音色未指定时自动获取音色列表供用户选择,默认使用 chat-girl-105-cn(晓曼)。 Use when user says: "tts", "text to speech", "语音合成", "文字转语音", "朗读", "生成语音", "生成音频", "转音频", "text to audio"
通过Google Cloud Text-to-Speech API实现文本转语音合成——支持MP3输出、可配置语言与语音、语音列表功能。
使用MOSS-TTS-Nano的专业技能指南,这是一款拥有0.1B参数、支持多语言实时语音合成(TTS)的模型,可在CPU上运行并支持语音克隆功能。