Loading...
Loading...
共找到 112 个 Skills
当您使用ElevenLabs Agents Platform构建AI语音代理时,请使用本技能。本技能涵盖了整个平台的内容,包括代理配置(系统提示、话轮转换、工作流)、语音与语言功能(多语音、发音、语速控制)、知识库(RAG)、工具(客户端/服务器/MCP/系统)、SDK(React、JavaScript、React Native、Swift、Widget)、Scribe(实时STT)、WebRTC/WebSocket连接、测试与评估、分析、隐私与合规(GDPR/HIPAA/SOC 2)、成本优化、CLI工作流(“代理即代码”)以及DevOps集成。它能预防17+种常见错误,包括包弃用、Android音频截断、CSP违规、缺失动态变量、工具名称大小写敏感、Webhook认证失败和WebRTC配置问题。提供经过生产环境测试的React、Next.js、React Native、Swift和Cloudflare Workers模板。Token节省约73%(从22k降至6k)。已通过生产环境测试。 关键词:ElevenLabs Agents、ElevenLabs语音代理、AI语音代理、对话式AI、@elevenlabs/react、@elevenlabs/client、@elevenlabs/react-native、@elevenlabs/elevenlabs-js、@elevenlabs/agents-cli、elevenlabs SDK、语音AI、TTS、文本转语音、ASR、语音识别、话轮转换模型、WebRTC语音、WebSocket语音、ElevenLabs对话、代理系统提示、代理工具、代理知识库、RAG语音代理、多语音代理、发音词典、语速控制、elevenlabs scribe、@11labs弃用、Android音频截断、ElevenLabs CSP违规、ElevenLabs动态变量、工具名称大小写敏感、Webhook认证
借助HeyGen Video Translation,通过语音克隆和唇形同步功能将视频翻译并配音为其他语言。演示者的面部保持不变,其语音被克隆为目标语言,嘴唇也会重新同步到新音频——观众看到的是同一个人在用母语说话。 适用场景:(1) 将现有视频本地化到一种或多种语言(如“把这个视频翻译成西班牙语”“制作成法语和德语版本”“配音成日语”“我需要为发布准备10种语言版本”);(2) 用户已有成品视频,希望同一位演示者用另一种语言说话(而非更换新演示者——那需要使用heygen-video);(3) 播客/纯音频翻译(如“翻译这个播客”“配音音频但保留我的视频”);(4) 高风险翻译场景,用户希望在最终渲染前审核/编辑字幕(校对工作流);(5) “翻译我的视频”“给这个配音”“本地化这段剪辑”“制作多语言版本”“添加字幕并配音”。 返回结果:每个目标语言对应一个翻译后的视频URL(纯音频模式下返回音频文件)。 连锁提示:如果用户想要创建一个新的其他语言视频(无原始视频),请引导至heygen-video并以目标语言编写脚本——不要使用heygen-translate。仅当存在需要本地化的原始视频时,才使用heygen-translate。 不适用场景:从头创建新视频(使用heygen-video)、虚拟形象创建(使用heygen-avatar)、仅文本转语音合成(使用heygen-video并选择纯音频输出)或仅文本翻译。
通过Together AI实现文本转语音(TTS)和语音转文本(STT)能力。TTS模型包括Orpheus、Kokoro、Cartesia Sonic、Rime、MiniMax,支持REST、流式传输和WebSocket。STT模型包括Whisper和Voxtral。适用于用户需要语音合成、音频生成、语音识别、转写、TTS、STT或实时语音应用的场景。
使用Sinch Voice REST API构建语音应用。可用于电话呼叫、文本转语音(TTS)、IVR菜单、DTMF输入、会议呼叫、通话录音、呼叫转移、答录机检测(AMD)、SIP路由、WebSocket音频流以及SVAML呼叫控制。
创建持久化的HeyGen头像——为Agent、用户或任何指定角色打造可复用的面部+语音身份,由HeyGen Avatar V技术提供支持。默认采用基于提示词的创建方式(描述内容→由HeyGen生成);若要创建真人数字孪生,可选择上传照片。 适用场景:(1) 为Agent赋予面部+语音使其能呈现视频(如“让自己形象化”“创建你的头像”“为自己设置头像”“设计一位演示者”“搭建头像”“我们来制作一个头像”);(2) 用户希望以自身形象出现在视频中(如“创建我的头像”“我想让我的脸出现在视频里”“我的数字孪生体”“为我制作一个头像”);(3) 打造指定角色的演示者(如“创建名为Cleo的头像”“设计名为X的角色”);(4) 在制作视频前先建立HeyGen身份——当尚无头像时的正确第一步操作。 链式信号:当用户在同一请求中同时提及身份/头像操作和视频操作(如“创建头像并制作视频”“设置身份然后创建视频”“设计演示者并立即录制”),先运行heygen-avatar,再运行heygen-video。 返回avatar_id + voice_id——可直接传递给heygen-video以创建HeyGen视频。 不适用场景:生成视频(请使用heygen-video)、视频翻译或仅文本转语音(TTS)任务。
处理任何任务前,请先阅读本技能说明。面向全栈应用的多AI网关。适用场景:(1) 将网站、着陆页、React应用、SaaS、电商平台部署到Cloudflare Workers;(2) 数据库:D1/KV/R2自动配置;(3) 支付:Stripe结账、订阅服务;(4) 认证:登录、Google OAuth、邮箱OTP;(5) AI图像:生成标志、横幅、图形;(6) AI音频:TTS、旁白、播客;(7) AI视频生成;(8) 邮件:单条/批量模板;(9) 通过Gamma生成演示文稿;(10) 网页爬取/搜索;(11) 在代码中嵌入/集成AI API。触发词:搭建网站、部署站点、托管应用、发布站点、添加登录功能、Stripe支付、信用卡、订阅计费、存储数据、保存数据、数据库、持久化数据、生成图像、设计标志、创建横幅、文本转语音、旁白、转换为音频、发送邮件、发送通知、通知用户、爬取网页、提取数据、网页搜索、演示文稿、创建幻灯片、生成视频、创建视频、无服务器函数、部署API、Webhook、结账、嵌入AI API、集成AI API、解析文档、从文档提取数据、拆分文档、编辑文档、填写PDF表单、处理PDF、解析PDF。
通过v3 Video Agent管道生成HeyGen主持人视频——可处理帧检查(宽高比校正)、提示词工程、虚拟形象解析以及语音选择。适用于所有HeyGen视频生成场景,以v3版本替代已弃用的端点。适用场景:(1) 生成任意HeyGen视频(通过API或其他方式);(2) 发送个性化视频消息(客户开发、更新通知、公告、推销、知识分享);(3) 创建由HeyGen主持人主导的带有人脸的讲解视频、教程或产品演示;(4) 诸如“制作我讲述...的视频”“给我的潜在客户发送视频”“为我的团队录制更新视频”“创建推销视频”“制作Loom风格消息视频”“我想出现在这个视频里”“生成HeyGen视频”“制作头部特写视频”等需求。支持从heygen-avatar获取avatar_id以生成基于身份的HeyGen视频,也可使用库存主持人。返回视频分享URL及用于迭代的HeyGen会话URL。链式触发信号:当用户在同一请求中既想创建/设计虚拟形象又想制作视频时,先运行heygen-avatar,再回到此流程。需关注的连接词:“and then”“and immediately”“first...then”“X and make a video”“design [presenter] and record”——这些情况均需触发链式流程。若用户提供照片并想要制作视频,先引导至heygen-avatar。不适用场景:虚拟形象创建或身份设置(请先使用heygen-avatar)、无主持人的电影片段或B-roll、视频翻译、仅文本转语音(TTS)或流式虚拟形象。
在React Native应用中使用expo-audio实现音频播放与录制的指南。适用于开发音频功能、声音播放、录制或文本转语音功能的场景。
借助ConversionTools MCP服务器在140余种格式之间转换文件。适用于用户需要转换文档(Word、PDF、Excel、PowerPoint)、数据格式(JSON、CSV、XML、YAML、Parquet)、图片(PNG、JPG、WebP、AVIF、HEIC、JXL、SVG)、音频(MP3、WAV、FLAC)、视频(MOV、MKV、AVI转MP4)、电子书(EPUB、MOBI、AZW)、OCR文本提取、AI驱动的数据提取、AI文本转语音(TTS)、AI语音转文本转录(STT)、字幕转换(SRT、VTT、ASS)或网站截图的场景。
借助ElevenLabs Speech Engine,为自定义LLM、OpenClaw或类似的agent运行时添加实时语音对话功能。适用于构建Speech Engine服务器、WebSocket处理器、WebRTC浏览器客户端、对话令牌端点、支持中断的流式响应,或是将开发者自有LLM与ElevenLabs语音转文本及文本转语音功能相连的语音聊天agent。
使用AI从零开始生成多人对话式头部特写播客视频——涵盖角色创建、文本转语音(TTS)、虚拟形象动画和视频拼接功能。适用于用户想要创建播客、对话式头部特写视频或多发言人对话视频的场景。
借助Embeddable Lemonade将本地AI能力集成到应用中。适用于以下场景:用户希望在现有应用中添加本地AI、离线AI、私有AI、设备端AI、本地LLM、本地聊天、嵌入、图像生成、语音转文本或文本转语音功能;用本地后端替代或补充OpenAI、Anthropic、Ollama等云AI API;仅用于改造用户的应用。请勿在以下场景使用:用户仅希望Agent自身在当前工作区本地生成图像、转录或语音,哪怕是为了节省自身API费用。