Loading...
Loading...
共找到 62 个 Skills
当您开发需要AI能力的Node.js后端服务或CloudBase云函数(Express/Koa/NestJS、serverless、后端API)时,请使用该技能。通过@cloudbase/node-sdk ≥3.16.0版本,可实现文本生成(generateText)、流式输出(streamText)以及图像生成(generateImage)功能。内置模型包括Hunyuan(推荐使用hunyuan-2.0-instruct-20251111)、DeepSeek(推荐使用deepseek-v3.2),以及用于图像生成的hunyuan-image。这是唯一支持图像生成的SDK,不适用于浏览器/网页应用(请使用ai-model-web)或微信小程序(请使用ai-model-wechat)。
支持文本生成图像(text-to-image)和图像生成图像(image-to-image)功能。适用于用户需要创建或生成图像的场景。使用场景:(1) 根据文本描述生成图像,(2) 使用参考图像生成,(3) 自定义模型、宽高比、分辨率。触发关键词:生成图像、绘图、创建图像、AI艺术。
面向 GPT Image 2 的图像生成 / 编辑技能。可在 3 种环境下使用:(A) Garden 本地模式,通过 OpenAI 兼容接口直接出图并落盘;(B) Host-Native 模式,把本 Skill 当作提示词工程指引,把渲染好的 prompt 交给宿主 Agent 自带的图像工具出图;(C) Advisor 模式,宿主无任何图像工具时退化为高质量 prompt 顾问。涵盖 18 大类、80+ 个结构化模板,覆盖海报 / UI / 产品 / 信息图 / 学术图 / 技术架构图 / 漫画 / 头像 / 流程板 / 电影分镜 / IP 周边 / 编辑工作流等场景。
生成具备多种布局类型和视觉风格的专业信息图。 分析内容,推荐布局与风格,生成可直接用于发布的信息图。 当用户要求创建“infographic”、“信息图”、“visual summary”或“可视化”时使用。
使用Google Gemini API处理和生成多媒体内容。功能包括分析音频文件(带时间戳的转录、摘要、语音理解、音乐/声音分析,最长支持9.5小时)、理解图像(图像描述、目标检测、OCR、视觉问答、分割)、处理视频(场景检测、问答、时序分析、YouTube URL支持,最长支持6小时)、从文档中提取信息(PDF表格、表单、图表、示意图、多页文档)、生成图像(文本生成图像、编辑、合成、优化)。适用于处理音频/视频文件、分析图像或截图、处理PDF文档、从媒体中提取结构化数据、根据文本提示创建图像或实现多模态AI功能的场景。支持多种模型(Gemini 2.5/2.0),上下文窗口最高可达200万token。
使用AI图像生成API(DALL-E、Replicate、fal.ai)生成游戏资产,并为Godot做好准备。涵盖从概念艺术、风格指南到最终精灵图、精灵图集和导入配置的完整美术工作流。在创建游戏美术、生成精灵图、制作tileset、创建UI元素或为Godot导入准备资产时,应使用此技能。关键词:游戏资产、AI美术、DALL-E、Replicate、fal.ai、精灵图集、tileset、Godot、像素画、角色精灵图、游戏美术、纹理、动画帧。
为图像和视频生成参考素材构建明确的「可学习/不可复制」协议。当提示词使用基准视频、选图稿、帧画面或产品图片,且你需要明确说明模型应学习的内容、必须更改的身份元素以及首次测试中应排除的参考素材时,可使用本工具。
从角色原画、截图、生成图像或视觉参考素材中创建、修复、验证、预览和打包兼容Codex的动画宠物精灵表(spritesheets)。当用户想要孵化Codex宠物、创建自定义动画宠物,或构建包含8x9图集、透明空白单元格、逐行动画提示、QA联系表、预览视频和pet.json打包的内置宠物资产时,可使用本技能。本技能整合了已安装的$imagegen系统技能用于视觉生成,并使用捆绑脚本进行确定性精灵表组装。
BFL FLUX API集成指南,涵盖端点、异步轮询模式、速率限制、错误处理、Webhook和区域端点,并提供Python和TypeScript代码示例。
生成1:1分屏(正面/背面)角色参考图,镜像还原上传图片中的面部、体态及服装细节。
帮助用户集成Runway图像生成API(含参考图的文本转图像功能)
设计高点击率(CTR)的YouTube缩略图——包含醒目图像、醒目的文字布局,必要时添加带有情绪的人物/主体。