Agent Harness
AI 军团协作的管控框架,让多个 Agent 在可控边界内并行工作的编排系统
简介
Agent Harness 是管理多个 AI Agent 协作的系统性框架。它不是某个具体工具或产品,而是一套架构思路——定义 AI 能用什么规则、什么工具,系统之间怎么连,想法如何按规范产出,产出如何追踪和审计。
这个概念由掘金用户”道里”在花了 5 万美金使用 Claude Code + Codex 后明确提出,他将 Harness 拆为四层架构:能力层、连接层、构建层、管控层。Anthropic 的 16 Agent 并行构建 C 编译器项目、OpenAI 的 Build AI-Native Engineering Team 框架、Claude Code 的 Agent Teams 功能,本质上都在做 Harness 这件事。
四层架构
能力层(Capability Layer)
AI 能用什么规则、什么工具。包括:
- 规则定义:AGENTS.md、CLAUDE.md 等行为规范文件
- 工具接入:MCP 协议连接外部能力
- 技能封装:Skill 把经验变成可复用能力包
- 知识注入:上下文工程,把业务知识结构化给到 AI
连接层(Connection Layer)
系统之间怎么连。包括:
- Agent 间通信:leader + teammate 共享任务列表
- 工具链编排:多个 MCP server 的串联和调度
- 数据流转:raw → wiki → publish 的管道设计
- 外部系统集成:API、数据库、CI/CD 的接入
构建层(Construction Layer)
想法如何按规范产出。包括:
- 任务分解:把大目标拆成 Agent 可执行的子任务
- 质量门禁:测试、lint、类型检查等自动验证
- 产出规范:PRD、代码、文档的格式和结构要求
- 迭代机制:plan → execute → review → refine 循环
管控层(Governance Layer)
产出如何追踪和审计。包括:
- 人机边界定义:哪些委派给 AI、哪些人来审查、哪些人必须拥有
- 执行监控:Agent 行为追踪、异常检测
- 风险控制:红线约束、回滚机制、CI 防止回退
- 审计日志:决策历史、变更记录
五层能力框架(产品经理视角)
2026-07-08-woshipm-ai-coding-harness 把 Agent Harness 从技术架构概念翻译成产品经理可直接使用的五层工作系统:
- 执行环境:让 AI 在远程机器、沙盒、dev container、worktree 里工作。关键不是炫技,而是隔离风险,让 AI 可以大胆执行但不能轻易破坏主工程。
- 对话上下文:一个 agent、一个频道、一个任务线程,把上下文拆开,避免多个目标互相污染。这与“一个目标一个工作台”的 PM 任务管理思维一致。
- 工程门禁:代码提交后自动跑格式检查、重复率检查、lint、命名规范、自动化测试、测试录屏和双重 code review,把“好不好”从最后的感觉固化为可重复检查。
- 治理节奏:不要让 AI 每天同时汇报八类问题,而是按主题处理:周一看代码质量、周二看体验验收、周三看用户反馈、周五优化流程。AI 可以并行,人类注意力必须被产品化。
- 自进化:记录 AI 执行中的摩擦,例如哪里缺权限、哪里缺工具、哪里总是绕路、哪里总要人手工补救,再把这些摩擦沉淀为工具、规则和自动化。
这五层框架补充了早期“四层架构”(能力层、连接层、构建层、管控层)的 PM 落地版本:四层架构回答 Harness 由哪些系统能力组成,五层能力回答产品经理如何把 AI 产能治理成可持续交付。
核心特性
从零自建 vs 基于成熟方案
自建 Agent Harness 的价值正在降低。原因:
- 模型迭代速度太快,小 team 根本跟不上
- 花几周沉淀的约束体系,模型能力一跳就变成多余的
- 模型公司(Anthropic、OpenAI)会持续提供基座 Harness
真正有价值的是基于成熟 Harness 做垂直方案:
- 为老工作流重新设计 AI Native 的 Agent 工作流
- 在 Human-in-the-Loop 部分重新设计 UI 和 UX 交互
- 垂直领域的高质量数据整理
- 把行业专家的判断路径变成 AI 可执行的流程
多 Agent 的本质价值
多 Agent 的价值不在于模拟人类分工,而在于:
- 隔离上下文:每个 Agent 在独立上下文里干活,错误不会传播
- 并行执行:多个任务同时推进,效率倍增
- 职责单一:每个 Agent 只做一件事,降低复杂度
但前提是 plan 质量够高——plan 烂了,9 个 agent 只是 9 倍速制造垃圾。
不同素材中的观点
道里(花了 5 万刀用 AI 写代码之后):Harness 是当下最务实的选择,但它是过渡态。本质上还是人在给 AI 写规则——定义边界、维护契约、设置验证门禁。未来 Harness 会从人写的静态规则,变成 AI 基于历史执行数据自我迭代的动态约束。四层架构(能力层、连接层、构建层、管控层)对任何项目或业务都通用。——来源:2026-06-13-juejin-50k-usd-ai-coding-lessons
人人都是产品经理(别再只会 Vibe Coding):当 AI Coding 进入大项目,瓶颈不再是 AI 会不会写代码,而是团队有没有执行环境隔离、上下文拆分、工程门禁、治理节奏和自进化机制。素材把 Harness 明确定位为“给 AI 搭生产系统”:Vibe Coding 适合点燃灵感,Harness 才能支撑生产。对 PM 来说,核心任务从投喂需求升级为设计 AI 工作系统,包括把需求写成可验收任务、把“好不好”固化为门禁、按主题组织 AI 汇报,并把重复治理从 Prompt 迁移到工具和流程。——来源:2026-07-08-woshipm-ai-coding-harness
Deep Agents 框架:LangChain 团队开源的 Agent Harness 实现,基于 LangGraph 执行引擎,提供工具注册、记忆管理、任务编排等标准化能力。验证了”基于成熟 Harness 做垂直方案”的路径。——来源:2026-06-13-deep-agents-framework-guide
AI 团队翻车案例:16 个 Agent 运营 13 个平台的实践暴露了没有 Harness 的后果——架构漏洞比工具故障更危险,管 Agent 和管人本质一样。反面验证了 Harness 管控层的必要性。——来源:2026-06-13-juejin-ai-team-crash-3-lessons
Nate Herk / Fable 5 一 prompt 搭公司:Harness 在本实验里体现为「可被 /goal 读入的 master prompt + 项目边界 + 模型路由」:no new spending(只用 .env)、publish nothing、invent nothing、never-ask、DoD=陌生人可 demo 的 recap HTML;编排者 Fable 5 只 plan/delegate/review(~500k token),工人 Opus/Sonnet;产物落在 site/video/research/business/brand/record 目录。这是管控层(预算与发布红线)+ 构建层(九阶段 arc)+ 连接层(HeyGen/ElevenLabs 等已有 key)同时上线的一次公司级 demo,而不是单文件 vibe coding。——来源:2026-07-26-youtube-fable5-one-prompt-business
叶小钗(通用 Agent 这么强,企业还要自己开发业务智能体吗?):把企业自研业务 Agent 拆成两件事——「搭运行底座」和「在底座上开发业务 Agent」。运行底座即 Agent harness(记忆管理、会话压缩、工具治理、状态保存、异常处理等基础能力),这一块通用 Agent 已相当完善,企业可复用;但自己开发业务 Agent 时,内部工具开发、业务规则梳理、流程梳理、效果验证这些业务侧工作,无论自研还是用通用 Agent 都不能省。作者用 Agent = Model + Harness 简化公式说明——模型负责生成回答或提出工具调用请求,Harness 是一套执行循环基础设施,把工具结果交回模型继续判断下一步,反复直到任务完成或满足停止条件。同时他给出判断:通用 Agent 的基本短板是「黑盒」——基本不提供完整执行日志,若业务要真正接入并需要可观测性/评测,通用 Agent 未必是最好选择;业务简单、不需太多观测/评测机制时,通用 Agent 的稳定运行机制反而是不错选择,也可考虑 agentScope、deepseek harness 等开源框架少做部分基建直接开发业务 Agent。——来源:2026-09-16-woshipm-enterprise-agent-harness
实用信息
判断是否需要 Harness
- 单 Agent 能搞定的任务,不需要 Harness
- 多 Agent 并行、需要跨系统协作、有质量要求时,Harness 才有价值
- 适合就好,不要追求完美的框架,够用、能跑、能迭代就行
Agent 是未来的操作系统
模型公司提供模型和 Harness(iOS/Android),真正的价值在上层应用。谁先在自己的领域里把 AI Native 的全链路跑通,谁就有壁垒——这个壁垒不是技术壁垒,是业务理解的壁垒。
相关页面
- AI Agent 智能体 — Agent 是 Harness 管理的基本单元
- AI 执行环境 — 执行环境是 Harness 能力层的核心组成
- 上下文工程 — 上下文管理是 Harness 的基础设施
- MCP 模型上下文协议 — MCP 解决了 Harness 连接层的工具接入问题
- Skill — Skill 解决了 Harness 能力层的知识封装问题
- Deep Agents — 一个具体的 Agent Harness 实现
- Claude Code — Agent Teams 是 Harness 的多 Agent 协作能力
- Fable 5
- Goal 提示语
- 2026-07-26-youtube-fable5-one-prompt-business