Loading...
Loading...
共找到 112 个 Skills
使用StepFun的stepaudio-2.5-asr进行音频转写——这是一个SSE端点(而非/v1/audio/transcriptions),具备32K上下文窗口,长音频处理速度约为实时速度的85-101倍(RTF),单次调用上限约为30分钟(无需客户端分片)。适用于以下场景:使用StepFun进行中英音频转写、需要通过单次请求处理5-30分钟的长时长录音、从step-asr/step-asr-1.1迁移时,或是遇到误导性错误`model stepaudio-2.5-asr not supported`(实际表示端点错误)时。触发关键词:阶跃ASR、StepFun ASR、stepaudio-2.5-asr、转录、语音识别、长音频转写、语音转文字。如需使用同系列的stepaudio-2.5-tts模型进行TTS(文本转语音),请改用stepfun-tts技能。
在FrameVideo HTML中创建视频合成、动画、标题卡、叠加层、字幕、旁白、音频响应式视觉效果和场景转场。当需要构建任何基于HTML的视频内容、添加与音频同步的字幕或副标题、生成文本转语音旁白、创建音频响应式动画(节拍同步、发光、随音乐脉动)、添加动画文本高亮(标记扫过、手绘圆圈、爆发线条、涂鸦、草图效果)或添加场景间转场(淡入淡出、擦除、揭示、着色器转场)时使用本技能。涵盖合成创作、时间控制、媒体处理以及完整的视频制作工作流。有关开发循环CLI命令(init、lint、inspect、preview、render)请查看framevideo-cli技能;有关资产预处理命令(tts、transcribe、remove-background)请查看framevideo-media技能;有关Chanjing数字人、OAuth和网站项目合成请查看chanjing-digital-human技能。
通过inference.sh CLI创建AI虚拟形象(AI avatar)和会说话的头部视频。推荐使用:P-Video-Avatar(速度最快、成本最低,内置TTS)。其他可选模型:OmniHuman、Fabric、PixVerse。功能特性:音频驱动虚拟形象、文本生成虚拟形象、唇形同步视频、会说话头部生成、虚拟主持人。适用场景:AI主持人、讲解视频、虚拟网红、配音、营销视频。相关关键词:ai avatar、talking head、lipsync、avatar video、virtual presenter、ai spokesperson、audio driven video、heygen alternative、synthesia alternative、talking avatar、lip sync、video avatar、ai presenter、digital human
使用ElevenLabs API生成AI旁白、音效和音乐。适用于为视频、播客或游戏创建音频内容的场景。可触发的任务包括生成旁白、解说、对话、根据描述生成音效、背景音乐、配乐生成、语音克隆或任何音频合成任务。
万物皆可解释——将想法转化为播客、解说视频或语音旁白。 适用于用户想要「制作播客」「创建解说视频」「朗读这段内容」「生成图片」或以音频/视觉形式分享知识的场景。 支持:主题描述、YouTube链接、文章URL、纯文本和图片提示词。
使用ElevenLabs语音AI将文本转换为语音。适用于从文本生成音频、制作旁白、构建语音应用或在70多种语言中合成语音的场景。
借助Kokoro或Noiz将文本转换为语音,支持简单模式和时间轴对齐模式。
通过填充词、情感调节和预设说话风格,让生成的语音具备同伴般的亲切感。
使用Chanjing TTS API,通过用户提供的声音将文本合成为语音
使用系统TTS(macOS/Linux上的say命令)或通过Chrome DevTools Protocol的浏览器TTS将文本朗读出来。适用场景:(1) 任务完成后需要播报结果;(2) 用户要求朗读内容;(3) 需要音频提醒的通知;(4) 无障碍功能——将内容朗读出来。
使用Chanjing TTS API将文本转换为语音
使用Sarvam AI的Bulbul v3模型将文本转换为自然语音。支持11种印度语言、30+种音色,可处理音频生成、旁白和语音交互场景。支持REST、HTTP流式传输、WebSocket协议以及发音词典功能。适用于将文本转换为有声音频的需求场景。