Loading...
Loading...
共找到 35 个 Skills
使用StepFun的stepaudio-2.5-tts生成中文/日文语音——这是一款上下文感知型TTS,它用自然语言格式的`instruction`(≤200字符)加上内嵌的`()`括号来控制句内韵律,取代了step-tts-2中的`voice_label`。当用户需要对语音合成进行情绪/韵律控制(如耳语、停顿、重音、句中情绪转折)、批量生成游戏/应用语音台词、从`step-tts-2`迁移(存在`voice_label`转为`instruction`的破坏性变更),或是遇到StepFun 2.5版本更严格的内容审核(包含“死”“消失”或政治敏感词汇)时,均可使用本工具。触发关键词包括:阶跃TTS、StepAudio合成、语音合成、配音、文本转语音、TTS升级、迁移step-tts-2。如需使用同系列的stepaudio-2.5-asr模型进行语音转文本,请改用stepfun-asr技能。
MiMo V2.5 TTS 语音合成。使用小米 MiMo V2.5 TTS 系列模型生成语音。当需要将文字转为语音、发送语音消息、朗读内容、或用户要求「说出来」「语音回复」时激活此 skill。支持预置音色、音色设计、音色克隆三种模式,支持自然语言控制、导演模式,支持语气、情绪、方言的风格标签控制,预置音色支持唱歌。
通过inference.sh CLI实现AI语音生成、文本转语音(TTS)与语音合成。支持模型:Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,可生成自然语音。功能特性:多音色、情感表达、口音模拟、长文本旁白、对话生成。适用场景:配音、有声书、播客、视频旁白、无障碍服务。相关关键词:语音克隆、tts、文本转语音、AI语音、语音生成、语音合成、配音、旁白、语音合成、AI旁白、ElevenLabs替代方案、自然语音、逼真语音、语音AI
使用Dia TTS创建多说话者对话音频。内容涵盖说话者标签、情绪控制、语速节奏、对话流程以及后期制作。适用场景:播客、有声书、讲解视频、角色对话、对话类内容。触发词:对话音频、多说话者、对话音频、Dia TTS、双说话者、播客音频、角色语音、配音、对话生成、对话TTS、多语音、说话者标签、对话录制
通过inference.sh CLI实现AI语音生成、文本转语音(text-to-speech)及语音合成。支持模型包括:Inworld TTS-2(支持100+种语言,可调控情绪/非语言表达)、Inworld TTS 1.5(超低延迟)、ElevenLabs(22+种优质语音,32种语言),以及Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,均可生成自然语音。功能特性:多语音选择、情绪调控、口音模拟、长篇旁白、对话生成、语音转换、交付模式控制、角色语音。适用场景:配音、有声书、播客、视频旁白、无障碍服务、游戏NPC语音、虚拟形象音频、UGC内容。相关触发词:语音克隆、tts、text to speech、ai voice、语音生成、语音合成、配音、旁白、语音合成、ai narrator、elevenlabs、eleven labs、自然语音、逼真语音、voice ai、变声器、inworld、inworld tts、角色语音、npc voice
借助Fish Audio生成AI文本转语音音频,并通过AceDataCloud API浏览公共参考语音。适用于制作旁白/解说音频(TTS)、合成多语言语音或从模型库中选择Fish参考语音的场景。
查找并使用媒体资源——通过Giphy搜索GIF、库存图片、来自OMDB/Letterboxd的影视数据、语音合成以及媒体上传功能。
使用ElevenLabs语音AI将文本转换为语音。适用于从文本生成音频、制作旁白、构建语音应用或在70多种语言中合成语音的场景。
使用HeyGen的Starfish TTS模型将文本转换为语音音频。适用于以下场景:(1) 从文本生成独立的语音音频文件;(2) 可选择语音、调节语速和音调的文本转语音转换;(3) 为旁白、解说或播客创建音频;(4) 调用HeyGen的/v1/audio接口;(5) 按语言或性别列出可用的TTS语音。
使用Chanjing TTS API将文本转换为语音
使用阿里云Model Studio Qwen TTS VD模型进行语音设计工作流。适用于通过文本描述创建自定义合成语音并将其用于语音合成的场景。
[QianWen] 借助Qwen TTS模型将文本转换为语音。触发场景:用户需要将文本转语音、制作旁白、生成音频解说、朗读文本、构建TTS应用,提及语音合成/语音生成/文本转音频输出,或明确通过名称调用此技能(例如:use qianwen-audio-tts)。不触发场景:用户需要语音识别/ASR、无需音频的文本生成、非Qwen相关的音频任务。