Agnes AI

提供免费/低价多模态生成 API 的平台:文生图、图生图、图生视频一站接入;官方用「文档指引 AI 生成 Skill」降低接入门槛,适合创意探索与原型验证,人物人脸一致性场景需分流到专用数字人工具。

简介

Agnes AI(站点 agnes-ai.com)是一套面向创作者与 Agent 工作台的生图/生视频 API 服务。与需要自行拼 REST 客户端、签名和轮询逻辑的传统 API 不同,Agnes 在文档页(/doc/cid5)直接给出「让 AI 帮你生成 Skill」的指引——用户把文档喂给 WorkBuddy 一类支持 Skill 的 Agent,即可得到可调用的程序性封装,再填入控制台 API Key 即可开跑。

产品能力覆盖三条主流 AIGC 链路:文生图图生图图生视频。生图侧提供 flash 系列模型(至少含 2.0 与 2.1),强调复杂场景与细节;生视频侧以 Video V2.0 为代表,支持最长约 18 秒、可自动生成配音。商业上采用「注册送免费额度 + Token Plan 付费档」双层,适合先验证效果再扩容。

需要清醒定位的是:Agnes 在氛围图、概念图、无身份特写场景性价比很高;但在特定真人身份一致性(个人 IP、数字人、品牌代言人)上,Video 侧目前不支持人脸锁定,图生图也会叠加模型自身的东亚(实测偏韩剧)审美先验。这类需求应把 Agnes 当创意前端,终稿链路切到 HeyGen 等专用方案。

关键信息

核心特性

模型与能力矩阵

模型 / 能力用途备注(来自实测)
agnes-image-2.0-flash生图Skill 内建
agnes-image-2.1-flash生图擅长复杂场景与丰富细节;旗袍江南水乡竖版约十几秒出图
agnes-video-v2.0生视频最长约 18 秒;可自动配音;无人脸锁定
文生图文本 → 图氛围/场景质量高
图生图参考图 + 文本 → 图保留身份痕迹但叠加模型审美
图生视频静图 → 视频运动中面部漂移;会放大审美先验

接入范式:文档驱动 Skill,而非手写 SDK

  1. 打开官方文档指引页,内容本身就是给 AI 的「如何生成 Skill」说明
  2. 将文档交给 WorkBuddy(或其他 Skill 宿主),自动生成调用封装
  3. 控制台创建 API Key;推荐写入系统环境变量,避免每次粘贴
  4. 用自然语言触发文生图 / 图生图 / 图生视频

这一范式把「会不会写 API 客户端」从门槛里拿掉,把重点转移到 Prompt 质量、场景选型与一致性预期管理

审美先验与一致性边界

  • 静图可掩盖、动态会暴露:图生图的「微妙违和」在静帧上常被理解为风格化;一旦进入视频运动 + 语音,审美体系(实测偏韩剧东亚面孔与神态)会被放大。
  • 默认语音可能非中文:实测自动配音出现韩语,需显式要求中文;改语言不改肢体与面部风格先验。
  • 与行业共性:人脸从静到动的一致性是多数 AI 视频模型的共同挑战;Agnes 当前不提供人脸锁定,故不能当作数字人主引擎。

工具类必填项

  • 安装 / 接入方式:无需本地 pip/npm 安装核心服务;通过 WorkBuddy 生成 Skill + 官网 API Key
  • 基本用法:自然语言描述画面或上传参考图 → 指定 flash / video 模型与分辨率 → 等待生成
  • 关键参数:模型选择(2.0 vs 2.1 flash)、分辨率与画幅(如 768×1024 竖版)、视频时长(≤18s)、语音语言
  • 适用场景:氛围图、概念图、产品背景、快速创意原型、学习 API/Skill 编写
  • 不适用:IP 形象终稿、数字人口播、要求与本人高度一致的个人品牌视频

不同素材中的观点

  • 2026-07-17-juejin-workbuddy-agnes-ai-api(小虎AI生活 · 掘金实测):全链路约 1 小时跑通,接入本身五分钟。文生图(旗袍江南)「构图光影细节在线」;图生图汉服茶室「像自己又不完全是」;图生视频面部漂移 + 默认韩语配音,倒推出模型韩系审美先验。明确分流:氛围/原型用 Agnes 免费额度;人物一致用 HeyGen。建议先免费后 Token Plan,价格对内容生产可忽略。

实用信息

快速上手步骤

  1. 打开 https://agnes-ai.com/doc/cid5
  2. WorkBuddy 读取文档并生成 Agnes API Skill(含 image 2.0/2.1 flash 与 video v2.0)
  3. 注册 agnes-ai.com → 控制台创建 API Key
  4. 将 Key 写入环境变量(Windows 系统环境变量示例见原文),供 WorkBuddy 自动读取
  5. 先跑一张无身份特写的氛围图验证链路,再决定是否充值 Token Plan

常用提示词 / 指令示例

一位穿旗袍的女性站在江南水乡的石桥边,晨光柔和,水面倒映着白墙黑瓦,电影级写实风格,浅景深。
用 2.1 Flash, 768x1024(竖版)

图生图:「用这张照片生成一张穿汉服在茶室品茶的图片。」
图生视频:「把这张图变成视频,让它动起来。」需要中文时追加:「配音用中文,不要韩语。」

注意事项 / 避坑

  • 别把免费 API 当数字人方案:无脸锁 + 审美先验,人物片必翻车预期要提前对齐
  • 先看静图再决定是否上视频:图生图已有违和感时,上视频只会放大而不是修复
  • 语音语言要显式指定:默认可能不是中文
  • 安全:API Key 用环境变量,勿写入可分享的 Skill 正文或截图
  • 成本习惯:即使当前免费,仍按标价心智管理调用量,避免日后计费突变时失控

相关页面