Loading...
Loading...
共找到 28 个 Skills
在RunComfy上使用Wan 2.7(Wan-AI的旗舰运动模型)生成文本转视频。本文档介绍了Wan 2.7的优势(多参考条件控制、通过`audio_url`实现音频驱动的唇形同步、更流畅的转场、提示词扩展)、时长/分辨率/宽高比规范,以及何时转而使用HappyHorse 1.0 / Seedance 2.0 / Kling / LTX 2。通过本地RunComfy CLI调用`runcomfy run wan-ai/wan-2-7/text-to-video`。当触发词为"wan"、"wan 2.7"、"wan-2-7"、"wan video"或任何明确要求使用该模型生成视频的请求时执行。
通过`runcomfy` CLI在RunComfy平台上为面部与指定音频轨道实现唇形同步。支持对接字节跳动OmniHuman(由肖像+音频驱动的全身体数字人)、Sync Labs sync v2/Pro(业界领先的视频唇形同步技术)、Kling lipsync(支持音频转视频和文本转视频的语音同步)以及Creatify lipsync。该技能会根据用户的实际需求选择合适的服务端点——包括肖像图片+音频(数字人风格)、源视频+音频(在现有视频上替换唇形)或基于脚本生成并同步。当用户说出“lip sync”“lipsync”“让这个视频说话”“匹配音频与唇形”“视频配音”“唇形与语音同步”“Sync Labs”“旁白同步”,或任何明确要求通过音频驱动面部唇形的指令时,该技能将触发。
在RunComfy上将任意静态图片动起来——该技能是一个智能路由工具,可将用户意图与RunComfy模型库中合适的i2v模型进行匹配。针对通用动画场景选择HappyHorse 1.0 I2V(竞技场排名第1,支持原生音频、身份保留);针对自定义旁白唇形同步场景选择带`audio_url`参数的Wan 2.7;针对图像+参考视频+参考音频的多模态动画场景选择Seedance 2.0 Pro。该技能整合了每个模型的文档提示模板,让调用者无需在错误模型上反复尝试即可获得更优质的输出。通过本地RunComfy CLI调用`runcomfy run <vendor>/<model>/image-to-video`(或其端点变体)。当触发词为"image to video"、"image-to-video"、"i2v"、"animate image"、"make this move"或任何明确要求将静态图转为视频的指令时,该技能启动。
使用AI虚拟形象、唇形同步和语音旁白制作会说话的头部视频。涵盖肖像要求、音频质量、OmniHuman、PixVerse唇形同步、Dia TTS等内容。适用场景:代言人视频、课程内容、社交媒体、演示文稿、产品演示。相关关键词:会说话的头部视频、虚拟形象视频、唇形同步、AI代言人、虚拟主持人、AI主持人、OmniHuman、会说话的虚拟形象、视频主持人、AI会说话的头部视频、主持人视频、AI人脸视频
通过inference.sh CLI,借助OmniHuman、Fabric、PixVerse创建AI头像和会说话的头部视频。支持模型:OmniHuman 1.5、OmniHuman 1.0、Fabric 1.0、PixVerse Lipsync。功能特性:音频驱动头像、唇形同步视频、会说话的头部生成、虚拟主持人。适用场景:AI主持人、讲解视频、虚拟网红、配音、营销视频。相关关键词:AI头像、会说话的头部、唇形同步、头像视频、虚拟主持人、AI发言人、音频驱动视频、Heygen替代方案、Synthesia替代方案、会说话的头像、唇形同步、视频头像、AI主持人、数字人
当需要使用阿里云Model Studio的视频编辑模型来实现风格迁移、关键帧控制编辑、唇形同步、Retalk或动画混剪等工作流时使用。
使用HeyGen将现有视频翻译并配音为多种语言。适用场景:(1) 将视频翻译成另一种语言,(2) 为视频内容进行唇形同步配音,(3) 创建现有视频的多语言版本,(4) 仅翻译音频不做唇形同步,(5) 使用HeyGen的/v2/video_translate端点。
使用EachLabs AI模型编辑、转换、拓展、放大和增强视频。支持唇形同步、视频翻译、字幕生成、音频合并、风格迁移和视频拓展。适用于用户想要编辑或转换现有视频内容的场景。
借助HeyGen Video Translation,通过语音克隆和唇形同步功能将视频翻译并配音为其他语言。演示者的面部保持不变,其语音被克隆为目标语言,嘴唇也会重新同步到新音频——观众看到的是同一个人在用母语说话。 适用场景:(1) 将现有视频本地化到一种或多种语言(如“把这个视频翻译成西班牙语”“制作成法语和德语版本”“配音成日语”“我需要为发布准备10种语言版本”);(2) 用户已有成品视频,希望同一位演示者用另一种语言说话(而非更换新演示者——那需要使用heygen-video);(3) 播客/纯音频翻译(如“翻译这个播客”“配音音频但保留我的视频”);(4) 高风险翻译场景,用户希望在最终渲染前审核/编辑字幕(校对工作流);(5) “翻译我的视频”“给这个配音”“本地化这段剪辑”“制作多语言版本”“添加字幕并配音”。 返回结果:每个目标语言对应一个翻译后的视频URL(纯音频模式下返回音频文件)。 连锁提示:如果用户想要创建一个新的其他语言视频(无原始视频),请引导至heygen-video并以目标语言编写脚本——不要使用heygen-translate。仅当存在需要本地化的原始视频时,才使用heygen-translate。 不适用场景:从头创建新视频(使用heygen-video)、虚拟形象创建(使用heygen-avatar)、仅文本转语音合成(使用heygen-video并选择纯音频输出)或仅文本翻译。
使用Chanjing Avatar API生成唇形同步视频
为任意URL生成约60-80秒的讲解视频——支持GitHub仓库、产品页面、文档站点、博客文章或发布页面。这是URL导览的标准工作流。当用户请求“讲解这个URL/仓库/网站/产品”“为[url]制作导览视频”“演示这个站点”“Loom风格的[url]讲解视频”“讲解github.com/...的内容”或“讲解这个产品链接”时即可使用。该工具会驱动真实浏览器访问目标URL,生成头像唇形同步效果,并将内容合成到1280×800的macOS Sonoma框架中,框架左下角带有一个246像素的圆形头像。GitHub URL会触发仓库感知模式(扫描README + 检测实时演示);其他URL则使用通用页面导览流程。
将视频翻译并配音为另一种语言。一次调用即可保留每位说话者的音色,翻译语音,并返回完全音视频同步的视频。默认开启唇形同步。当用户说“translate this video”、“dub this in <language>”、“make this Spanish/French/Japanese”、“translate the audio”,或要求在配音/语言转换输出上添加双语字幕时使用。不适用于:仅添加字幕/字幕文件(使用add_captions或video-captions)、仅转录(直接使用transcribe_audio),或翻译屏幕上的文字叠加层。