Loading...
Loading...
共找到 112 个 Skills
HyperFrames 合成内容的资源预处理工具——包含文本转语音旁白(Kokoro)、音视频转录(Whisper)、以及用于透明叠加层的背景移除(u2net)功能。适用于从文本生成配音、转录语音生成字幕、移除视频/图片背景以制作透明叠加层、选择TTS语音或Whisper模型,或者将这些功能串联使用(文本转语音→转录→生成字幕)。每个命令首次运行时会自动下载对应的模型。
ElevenLabs文本转语音服务,拥有22+种优质语音、多语言支持,可通过inference.sh CLI进行语音调优。模型包括:eleven_multilingual_v2(最高音质)、eleven_turbo_v2_5(低延迟)、eleven_flash_v2_5(超快速)。功能:文本转语音、语音选择、稳定性/风格控制、支持32种语言。适用场景:旁白配音、有声书、视频解说、播客、无障碍服务、交互式语音应答(IVR)。触发词:elevenlabs、eleven labs、elevenlabs tts、premium tts、professional voice、ai voice、high quality tts、multilingual tts、eleven labs voice、voice generation、natural speech、realistic voice、voice over、speech synthesis
通过inference.sh CLI,使用DIA TTS、Kokoro、Chatterbox等工具将文本转换为自然语音。 模型:DIA TTS(对话式)、Kokoro TTS、Chatterbox、Higgs Audio、VibeVoice(播客专用)。 功能:文本转语音、语音克隆、多说话人对话、播客生成、富有表现力的语音。 适用场景:配音、有声书、播客、无障碍服务、视频旁白、IVR、语音助手。 相关关键词:文本转语音、TTS、语音生成、AI语音、语音合成、配音、生成语音、AI旁白、语音克隆、文本转音频、ElevenLabs替代方案、语音AI、AI配音、语音生成器、自然语音
通过inference.sh CLI实现AI语音生成、文本转语音(TTS)与语音合成。支持模型:Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,可生成自然语音。功能特性:多音色、情感表达、口音模拟、长文本旁白、对话生成。适用场景:配音、有声书、播客、视频旁白、无障碍服务。相关关键词:语音克隆、tts、文本转语音、AI语音、语音生成、语音合成、配音、旁白、语音合成、AI旁白、ElevenLabs替代方案、自然语音、逼真语音、语音AI
借助文本转语音、音乐生成及音频编辑功能创建AI驱动的播客。工具包括:Kokoro TTS、DIA TTS、Chatterbox、AI音乐生成工具、媒体合并工具。核心功能:多角色语音对话、背景音乐添加、片头/片尾制作、完整播客剧集生成。适用场景:播客制作、有声书、语音内容、音频新闻通讯。关联关键词:播客、AI播客、文本转语音播客、音频内容、旁白、AI有声书、多语音、对话AI、NotebookLM替代方案、音频生成、播客自动化、AI旁白、语音内容、音频新闻通讯、播客制作工具
通过inference.sh CLI实现AI语音生成、文本转语音(text-to-speech)及语音合成。支持模型包括:Inworld TTS-2(支持100+种语言,可调控情绪/非语言表达)、Inworld TTS 1.5(超低延迟)、ElevenLabs(22+种优质语音,32种语言),以及Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,均可生成自然语音。功能特性:多语音选择、情绪调控、口音模拟、长篇旁白、对话生成、语音转换、交付模式控制、角色语音。适用场景:配音、有声书、播客、视频旁白、无障碍服务、游戏NPC语音、虚拟形象音频、UGC内容。相关触发词:语音克隆、tts、text to speech、ai voice、语音生成、语音合成、配音、旁白、语音合成、ai narrator、elevenlabs、eleven labs、自然语音、逼真语音、voice ai、变声器、inworld、inworld tts、角色语音、npc voice
借助Fish Audio生成AI文本转语音音频,并通过AceDataCloud API浏览公共参考语音。适用于制作旁白/解说音频(TTS)、合成多语言语音或从模型库中选择Fish参考语音的场景。
使用Kokoro TTS实现文本转语音的专业技能,涵盖语音合成、音频生成、性能优化以及为JARVIS语音助手安全处理生成的音频。
通过WebSocket使用Azure OpenAI的GPT Realtime Mini模型生成由AI驱动的播客风格音频叙事。适用于构建文本转语音功能、音频叙事生成、从内容创建播客,或与Azure OpenAI Realtime API集成以实现实时音频输出。涵盖了从React前端到Python FastAPI后端的全栈实现,支持WebSocket流式传输。
当用户请求通过OpenAI Audio API进行文本转语音旁白、配音、无障碍朗读、音频提示或批量语音生成时使用;使用内置语音运行捆绑的CLI(`scripts/text_to_speech.py`),实时调用需要`OPENAI_API_KEY`。自定义语音创建不在本技能范围内。
通过fal.ai MCP实现统一媒体生成——支持图片、视频和音频。涵盖文本转图片(Nano Banana)、文本/图片转视频(Seedance、Kling、Veo 3)、文本转语音(CSM-1B)以及视频转音频(ThinkSound)。当用户需要用AI生成图片、视频或音频时使用。
借助fal.ai音频模型实现文本转语音(TTS)与语音转文本(STT)功能。当用户提出“将文本转换为语音”“转录音频”“生成语音”“语音转文本”“TTS”“STT”或类似音频相关需求时使用。