Loading...
Loading...
共找到 9 个 Skills
HyperFrames 合成内容的资源预处理工具——包含文本转语音旁白(Kokoro)、音视频转录(Whisper)、以及用于透明叠加层的背景移除(u2net)功能。适用于从文本生成配音、转录语音生成字幕、移除视频/图片背景以制作透明叠加层、选择TTS语音或Whisper模型,或者将这些功能串联使用(文本转语音→转录→生成字幕)。每个命令首次运行时会自动下载对应的模型。
通过inference.sh CLI实现AI语音生成、文本转语音(TTS)与语音合成。支持模型:Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,可生成自然语音。功能特性:多音色、情感表达、口音模拟、长文本旁白、对话生成。适用场景:配音、有声书、播客、视频旁白、无障碍服务。相关关键词:语音克隆、tts、文本转语音、AI语音、语音生成、语音合成、配音、旁白、语音合成、AI旁白、ElevenLabs替代方案、自然语音、逼真语音、语音AI
借助文本转语音、音乐生成及音频编辑功能创建AI驱动的播客。工具包括:Kokoro TTS、DIA TTS、Chatterbox、AI音乐生成工具、媒体合并工具。核心功能:多角色语音对话、背景音乐添加、片头/片尾制作、完整播客剧集生成。适用场景:播客制作、有声书、语音内容、音频新闻通讯。关联关键词:播客、AI播客、文本转语音播客、音频内容、旁白、AI有声书、多语音、对话AI、NotebookLM替代方案、音频生成、播客自动化、AI旁白、语音内容、音频新闻通讯、播客制作工具
Voicebox专属进阶技能——基于Tauri、React和FastAPI构建的开源本地语音克隆与TTS工作室
当用户要求根据文本内容生成、创建或制作播客时,可使用此Skill。它能将书面内容转换为双主播对话式的播客音频格式,对话自然流畅。
使用ModelsLab的v7 Voice API生成语音、音乐和音效。通过ElevenLabs和Inworld模型支持文本转语音、语音转文本、语音转语音、音乐生成、音效制作、配音、歌曲扩展以及歌曲补全功能。
完整的ElevenLabs AI音频平台:包含文本转语音(TTS)、语音转文本(STT/Scribe)、语音克隆、语音设计、音效生成、音乐生成、配音、变声、人声分离以及对话式语音Agent。适用于音频生成、语音合成、转录、音频处理或构建语音交互应用场景。触发项:生成语音、克隆语音、音频转录、创建音效、创作音乐、视频配音、变声、分离人声、构建语音Agent、ElevenLabs API/SDK/CLI/MCP。
HyperFrames CLI 工具——包含hyperframes init、lint、preview、render、transcribe、tts、doctor、browser、info、upgrade、compositions、docs、benchmark等命令。适用于项目搭建、组合校验、工作室预览、视频渲染、音频转写、TTS生成或HyperFrames环境故障排查场景。
DashScope(阿里云百炼)集成——包含图像生成(qwen-image-2.0-pro)、文本转语音(qwen3-tts-flash)以及带词级时间戳的自动语音识别(qwen3-asr-flash-filetrans)。适用于通过Qwen-Image生成图像、通过Qwen-TTS生成旁白,或通过Qwen-ASR生成带词级时间戳的转录内容的场景。