Loading...
Loading...
共找到 63 个 Skills
使用ModelsLab的v7 Video Fusion API,通过文本提示生成视频或让静态图片动起来。支持文本转视频、图片转视频、视频转视频、唇形同步和运动控制功能,涵盖Seedance、Wan、Veo、Sora、Kling和Hailuo等40余种模型。
通用AI视频生成工具,支持OpenAI Sora、Google Veo 2/3、Runway Gen-3/Gen-4、Pika 2.2、Luma Dream Machine(Ray 2)、FAL(Kling/Wan/Veo/Sora封装)、Ark Seedance 1.5 Pro/Lite、百炼万相(i2v)、MiniMax 海螺-02以及Vidu Q3。当用户要求根据文本提示或首帧图像生成、创建、制作或合成视频时,使用此技能。支持文本转视频和图像转视频,部分支持的提供商还可选末帧控制。典型触发语句包括“generate a video of ...”“make a 5-second clip of ...”“animate this image”“生成一段视频”“做个短片”,或提及任何视频生成模型系列,如Sora、Veo、Runway Gen、Kling、Wan、Seedance、海螺、Pika、Dream Machine、Vidu。即使用户未指定具体模型,也需使用此技能——从其EXTEND.md默认配置或可用API密钥中选择提供商。若用户明确提及即梦/Dreamina/Jimeng,则不要使用此技能,应转至happy-dreamina。
通过mmx CLI生成、监控和下载MiniMax-H3视频。适用于H3文本转视频、首尾帧视频、多模态参考图/视频/音频生成、H3提示词优化、媒体预检、按需付费(Pay-as-you-go)API密钥选择、任务等待、下载以及H3故障处理。
通过EachLabs使用ByteDance Seedance 2.0(Fast版本)生成带有原生同步音频的电影级视频。支持文本转视频(bytedance-seedance-2-0-text-to-video-fast)和图片转视频(bytedance-seedance-2-0-image-to-video-fast)。当用户明确要求使用Seedance 2.0、需要视频附带原生音频、逼真物理效果、导演级镜头控制,或者需要4-15秒最高720p分辨率的视频片段时使用。
帮助用户集成Runway视频生成API(文本转视频、图像转视频、视频转视频)
适用于为单个镜头编写FLUX 3文本转视频提示词。涵盖镜头技巧、可靠的概念模式、镜头运用、连续性和审核要点。
生成视频片段:文本转视频(prompt-to-video)、图片转视频(image-to-video)、参考引导生成、视频扩展、超分辨率提升(upscale)、重构图(reframe);文本内容→转动态效果。先低成本生成草稿,再渲染高质量最终版本。按使用量计费。
通过`runcomfy` CLI在RunComfy上创建AI头像、虚拟主播(Talking-Head)及唇同步视频。支持调用字节跳动OmniHuman(音频驱动全身头像)、万智源Wan 2-7(通过`audio_url`实现人像音频驱动嘴部同步)、HappyHorse 1.0(竞技场排名第一的文本转视频/图像转视频,支持内置音频)以及Seedance v2 Pro(多模态影视级生成,支持参考音频+参考主体)等模型。会根据用户的实际需求——UGC旁白、虚拟主持人、配音产品演示、唇同步角色、对话场景——选择合适的模型,并提供各模型的文档化提示模板以及最简`runcomfy run`调用指令。当用户提及“talking head”“lip sync”“avatar video”“让X说话”“audio to video”“audio driven avatar”“virtual presenter”“AI spokesperson”“dubbed video”“UGC avatar”“HeyGen替代方案”“Synthesia替代方案”“digital human”“让这张人像说话”“从旁白生成视频”或任何明确要求让面部开口说话的请求时,该功能将触发。
通过`runcomfy` CLI在RunComfy平台上为面部与指定音频轨道实现唇形同步。支持对接字节跳动OmniHuman(由肖像+音频驱动的全身体数字人)、Sync Labs sync v2/Pro(业界领先的视频唇形同步技术)、Kling lipsync(支持音频转视频和文本转视频的语音同步)以及Creatify lipsync。该技能会根据用户的实际需求选择合适的服务端点——包括肖像图片+音频(数字人风格)、源视频+音频(在现有视频上替换唇形)或基于脚本生成并同步。当用户说出“lip sync”“lipsync”“让这个视频说话”“匹配音频与唇形”“视频配音”“唇形与语音同步”“Sync Labs”“旁白同步”,或任何明确要求通过音频驱动面部唇形的指令时,该技能将触发。
通过inference.sh CLI使用阿里巴巴HappyHorse 1.0模型生成和编辑视频。包含模型:HappyHorse T2V、I2V、R2V、视频编辑模型。功能:文本转视频、图片转视频、参考图转视频、自然语言视频编辑、角色保留、支持720P/1080P分辨率、最长15秒时长。适用场景:真实物理效果视频、视频编辑、角色一致性内容、产品演示、社交媒体。触发关键词:happyhorse、happy horse、alibaba video、happyhorse 1.0、dashscope video、alibaba happyhorse、video editing ai、ai video editor
本技能使用官方google-genai SDK实现生成式视频编辑、文本转视频、图像参考视频生成以及首帧转视频过渡动画功能。包含使用ffmpeg预处理/优化高分辨率或长时长源视频、剥离音频以重新生成完整音效、逐轮视频编辑和并行执行等工作流。
MiniMax多模态模型技能——使用MiniMax多模态模型处理语音、音乐、视频和图像。借助MiniMax AI创建语音、音乐、视频和图像:TTS(文本转语音、语音克隆、语音设计、多片段)、音乐(歌曲、纯音乐)、视频(文本转视频、图像转视频、首尾帧、主体参考、模板、多场景长视频)、图像(文本转图像、带人物参考的图像转图像),以及媒体处理(格式转换、拼接、裁剪、提取)。当用户提及MiniMax、多模态生成,或需要语音/音乐/视频/图像AI、MiniMax API,或结合MiniMax输出的FFmpeg工作流时使用。