Loading...
Loading...
共找到 71 个 Skills
借助ElevenLabs Speech Engine,为自定义LLM、OpenClaw或类似的agent运行时添加实时语音对话功能。适用于构建Speech Engine服务器、WebSocket处理器、WebRTC浏览器客户端、对话令牌端点、支持中断的流式响应,或是将开发者自有LLM与ElevenLabs语音转文本及文本转语音功能相连的语音聊天agent。
可被Agent调用的ElevenLabs工具——将文本转换为语音音频、创建音效和多角色对话、重新配音并清理音频、转录音频和视频、设计合成语音,以及管理语音、生成历史和配额。当用户提及ElevenLabs或需要AI音频相关工作时使用——包括文本转语音、旁白、配音、转录、变声或音效设计——即使用户没有明确提到ElevenLabs,例如“把这段内容读出来”“把这个做成MP3”“转录这段录音”。
通过`runcomfy` CLI在RunComfy平台使用ACE Step生成、修复(inpaint)和扩展(outpaint)音乐。ACE Step是StepFun-AI推出的开源权重音乐基础模型——支持标签驱动创作(涵盖流派、情绪、乐器)、带段落标记的多语种歌词,可生成5秒至4分钟的立体声输出,每秒成本为0.0002–0.0003美元(约比ElevenLabs Music便宜27倍)。提供四个端点:ACE Step文本转音频(默认选项)、ACE Step 1.5文本转音频(支持50+语种歌词,优化了结构化歌词处理)、ACE Step音频修复(重新生成现有音轨中的指定时间段内容)、ACE Step音频扩展(在现有音轨的前后添加内容)。当触发词为“ace step”、“ace-step”、“acestep”、“ACE music”、“open music model”、“cheap AI music”、“inpaint audio”、“audio inpaint”、“extend music”、“audio outpaint”、“lengthen track”、“music with tags”,或任何明确要求使用ACE Step生成或编辑音乐的指令时,该工具将启动。
通过inference.sh CLI,使用DIA TTS、Kokoro、Chatterbox等工具将文本转换为自然语音。 模型:DIA TTS(对话式)、Kokoro TTS、Chatterbox、Higgs Audio、VibeVoice(播客专用)。 功能:文本转语音、语音克隆、多说话人对话、播客生成、富有表现力的语音。 适用场景:配音、有声书、播客、无障碍服务、视频旁白、IVR、语音助手。 相关关键词:文本转语音、TTS、语音生成、AI语音、语音合成、配音、生成语音、AI旁白、语音克隆、文本转音频、ElevenLabs替代方案、语音AI、AI配音、语音生成器、自然语音
通过inference.sh CLI实现AI语音生成、文本转语音(TTS)与语音合成。支持模型:Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,可生成自然语音。功能特性:多音色、情感表达、口音模拟、长文本旁白、对话生成。适用场景:配音、有声书、播客、视频旁白、无障碍服务。相关关键词:语音克隆、tts、文本转语音、AI语音、语音生成、语音合成、配音、旁白、语音合成、AI旁白、ElevenLabs替代方案、自然语音、逼真语音、语音AI
通过inference.sh CLI实现AI语音生成、文本转语音(text-to-speech)及语音合成。支持模型包括:Inworld TTS-2(支持100+种语言,可调控情绪/非语言表达)、Inworld TTS 1.5(超低延迟)、ElevenLabs(22+种优质语音,32种语言),以及Kokoro TTS、DIA、Chatterbox、Higgs、VibeVoice,均可生成自然语音。功能特性:多语音选择、情绪调控、口音模拟、长篇旁白、对话生成、语音转换、交付模式控制、角色语音。适用场景:配音、有声书、播客、视频旁白、无障碍服务、游戏NPC语音、虚拟形象音频、UGC内容。相关触发词:语音克隆、tts、text to speech、ai voice、语音生成、语音合成、配音、旁白、语音合成、ai narrator、elevenlabs、eleven labs、自然语音、逼真语音、voice ai、变声器、inworld、inworld tts、角色语音、npc voice
使用ElevenLabs或Qwen3-TTS为你的视频设计并生成AI语音,支持声音克隆、描述式自定义以及口型同步功能。适用场景:**打造品牌专属语音** - 为营销活动确定统一语气;**克隆已有声音** - 经授权复刻特定人声;**设计原创语音** - 根据文字描述生成全新音色;**多角色场景** - 管理同一视频内的多个语音配置;**AI视频口型同步** - 同步语音与唇...
借助EachLabs AI模型实现文本转语音、语音转文本、声音转换及音频处理功能。支持ElevenLabs TTS、带说话人分离的Whisper转写以及RVC声音转换。适用于用户需要文本转语音、语音转写或声音转换的场景。
借助TTS(文本转语音)自动播报计划、问题及总结内容。在完成敲定计划、解决问题或生成总结等重要任务后,可主动使用该技能。每个项目配备专属语音,用户在其他房间也能分辨是哪个项目的播报内容。当遇到速率限制时,将按顺序(google、openai、elevenlabs、say)切换备用服务商。
借助ElevenLabs、Qwen3-TTS及其他平台,为你的内容挑选并打造理想的AI语音——让语音特征与品牌个性及受众相匹配。适用场景:为视频旁白选择AI语音;在各类内容中打造统一的品牌语音;克隆语音以实现规模化内容生产;对比语音合成平台;通过描述定制语音特征
包含35+模型的AI内容生成套件。通过FAL AI、Google Vertex AI、ElevenLabs实现图像生成、视频创作、音频处理,支持流水线编排与成本管理。
语音AI应用构建专家——从实时语音Agent到语音赋能应用。涵盖OpenAI Realtime API、用于语音Agent的Vapi、用于转录的Deepgram、用于语音合成的ElevenLabs、用于实时基础设施的LiveKit,以及WebRTC基础。懂得如何构建低延迟、可投入生产的语音体验。适用场景:语音AI、语音Agent、语音转文字、文字转语音、实时语音。