Fable 5 自我改进系统实战:14 步打造会「复利」的 AI 代理

BlockTempo 翻译整理 0xCodez 的 Fable 5 自我改进代理系统路线图。核心不是让模型“自我学习”或修改权重,而是把 Fable 5 放进会累积状态、Skill、验证与工作流的系统里,让每次执行把环境磨得更锋利。

基本信息

  • 标题:Fable 5 自我改進系統實戰:14 步打造會「複利」的 AI 代理
  • 来源:BlockTempo(動區動趨)
  • 原始 URLhttps://www.blocktempo.com/self-improving-agent-fable-5-2/
  • 采集方式:Telegram bot prefetch
  • 原始素材路径raw/articles/2026-07-06-203540-tg-1dbe62.md
  • 处理说明:raw 文件在主文后混入了 Kraken 代币化股票抵押和 JWST 早期宇宙报道等推荐位正文,本摘要只消化标题所对应的 Fable 5 自我改进代理系统主文。

核心观点

  1. Fable 5 的重点不是“更大的 Sonnet”,而是数日级自主编排能力。 文章强调,多数人把 Fable 5 当成更大上下文的 Sonnet 4.6,只跑 5 分钟就关掉,等于用 Mythos 级定价做短会话任务。Fable 5 真正匹配的场景是跨阶段规划、子代理委派、自我验证、视觉检查、大型迁移、复杂实现和多阶段知识工作。

  2. “自我改进”不是模型改权重,而是系统环境会复利。 文中明确区分 self-learning 与 self-improving:前者指代理更新模型权重,当前公开生产模型不具备;后者指代理周围的状态文件、Skills、评估循环、记忆和验证规则持续累积。模型本身无状态,但它运行的环境可以变得越来越有记忆、越来越少重犯旧错。

  3. 复利堆栈由四层构成:原语、编排、记忆、自我改进。 Layer 1 是 Fable 5、子代理、worktrees 和工具;Layer 2 是 /goal、Outcomes、动态工作流和 Routines;Layer 3 是 STATE.md、Skills、Knowledge Bases、Lessons learned;Layer 4 是视觉自我检查、eval 循环、规则蒸馏。输出向上流经评估与蒸馏,再写回记忆,下一轮执行继承更好的环境。

  4. 独立验证者比自我批评更关键。 文章引用 Anthropic 工程团队观点:Fable 5 做自我批评仍会偏爱自己的推理轨迹,独立验证者子代理只看产出物与评分标准,能更有效约束“够好了就停”的倾向。Parameter Golf 实验中,Fable 5 搭配验证者敢于尝试更大的结构性变更,并能穿过一次量化退步继续调查。

  5. 模型路由要按任务复杂度,而不是全程烧 Fable 5。 文中给出成本—能力矩阵:Fable 5 每 token 成本约是 Opus 4.8 的 5 倍,适合作为重量级编排者;Opus 4.8 处理困难但有界的架构、调试和审查;Sonnet 4.6 做高量工人任务;Haiku 4.5 做廉价验证者和分类器。经济性来自“Fable 5 编排 + 低成本子任务”的组合,而不是默认全用最高级模型。

  6. 状态文件和 Skill 是复利发生的实际载体。 STATE.md 负责记录 verified facts、general rules、open failures、lessons learned、last session;Skill 负责把跨项目适用的教训写进程序性知识。每次离开前更新状态、每次开始前读取状态,才能避免下一次从零重启。每个确认过的教训如果只留在对话里,就不会变成长期能力。

  7. 长时间自治需要 Routines / CMA 这类云端执行层,而不是本地笔记本。 文章把 Routines 描述为保存好的 Claude Code 配置(提示、仓库、连接器、权限),可由排程、API、GitHub 事件触发,在 Anthropic 托管基础设施上运行。晨间 eval、CI 失败调查、PR 技能评估都属于“你睡觉时系统继续磨利”的模式。

  8. 安全边界应设计成显式后备,而不是静默失败。 文中指出 Fable 5 对资安、生物、化学、模型蒸馏等高风险领域有分类器限制,可能后备到 Opus 4.8。自我改进系统必须让 Skill 和编排层知道哪些任务可能触发分类器,并把后备或人工审查显式呈现,否则安全拒绝会和真实错误一样变成无声退步。

14 步路线图提炼

PART 1 · Fable 5 解锁了什么

  1. Fable 5 是 Mythos 级模型,重心是数日级自主工作阶段:跨阶段规划、委派子代理、自写测试、视觉检查、大型迁移和复杂知识工作。
  2. 自我改进不等于自我学习:模型不更新权重,系统通过记忆、Skill、状态与 eval 复利。
  3. 四层复利架构:Primitives → Orchestration → Memory → Self-improvement,关键是让每次输出被评分、蒸馏并写回记忆。
  4. 成本—能力矩阵:Fable 5 做编排者,Opus 做困难有界子任务,Sonnet 做高量工人,Haiku 做验证者/分类器。

PART 2 · 三个原语

  1. /goal vs Outcomes:二者都是目标驱动迭代循环;Claude Code 本地任务用 /goal,CMA 托管长任务用 Outcomes。
  2. 验证者子代理胜过自我批评:执行者和评分者必须隔离上下文,避免“自产自销”。
  3. 动态工作流组合自我修正模式:Fan-out-and-synthesize、Adversarial verification、Loop until done 是自我改进系统里最有价值的三类模式。
  4. Worktrees 确保平行安全:多个代理并行写文件时必须隔离签出,避免实验、实现和验证互相污染。
  5. Routines 承接数日编排:用排程、API、GitHub 事件触发云端例行任务,让 eval、triage、Skill 蒸馏在无人值守时继续运行。

PART 3 · 自我改进层

  1. 记忆的五阶段递进:Fail → Investigate → Verify → Distill → Consult。Fable 5 的优势在于更可能走完整条链,而不是只留下失败笔记。
  2. 状态文件是记忆实际栖身之处:STATE.md 应包含 Verified facts、General rules、Open failures、Lessons learned、Last session。
  3. 会复利的 Skills 把教训写进 Skill 本身:STATE.md 偏项目记忆,Skill 偏程序记忆;Skill 会随真实失败和事后检讨变锋利。
  4. 视觉自我验证适合 UI / 图表 / 设计任务:制作者渲染截图,验证者用视觉对照目标描述、design tokens 和历史截图,差异再回流到循环。
  5. Mythos 安全边界要做架构化后备:资安、生物、化学、蒸馏等领域的分类器限制应被视为设计约束,而不是 bug。

实操内容保留

代码/配置

原文没有完整代码实现,但提供了 Routines 的排程指令示例,保留如下:

> /schedule daily at 7am, use Fable 5 in CMA
  Goal: Re-run yesterday's eval suite against the latest skills.
  Any test that newly passes → distill the pattern into the skill.
  Any test that newly fails → investigate, document in STATE.md.
  Post the digest to #engineering. /goal don't stop until digest is
  posted and STATE.md is updated.
 
▲ Claude
  Creating routine: nightly-eval-compounding
  - model: claude-fable-5
  - harness: claude managed agent (sandbox)
  - trigger: schedule (0 7 * * *)
  - grader: independent Haiku sub-agent (Outcomes)
✓ Active. First run tomorrow 07:00 local. Skill set will compound.

状态文件模板

原文给出的 STATE.md 结构是本篇最有复用价值的模板:

# Project memory · trading-platform
 
## Verified facts # stage 3 — stop guessing about these
- prc is in dollars, not cents. Verified via SELECT MIN(prc), MAX(prc) FROM trades.
- user_id matches auth_users.uid via JOIN, not auth_users.id. Confirmed 2026-06-09.
- Test database uses Stripe sandbox keys; production uses real keys via env.
 
## General rules # stage 4 — consult before re-deriving
- When querying time-bucketed metrics, always include timezone (default UTC mismatches).
- Auth middleware order matters: rate_limit -> jwt -> rbac. Reversing causes 401s.
- For migrations, never use ALTER on tables >1M rows without batching.
 
## Open failures (investigate next session) # stage 1 → 2
- 2026-06-09: tests/e2e/checkout flakes ~1 in 50 runs. Hypothesis: webhook race.
  Reproduction steps in debug/checkout-flake.md.
 
## Lessons learned # stage 4 distillations
- PowerShell hits TLS 1.2 issue on Windows CI runners. Always shell out to bash.
- Stripe webhook tests require STRIPE_WEBHOOK_SECRET. Skip with clear message if missing.
 
## Last session # stage 5 — resume, don't restart
2026-06-10 03:30 UTC · 7 failures classified, 3 fixes drafted (claude/fix-*), 4 escalated.
Next: verify the auth middleware fix in claude/fix-rate-limit-order against production load.

Skill 复利模板

原文还给出一个会随失败案例增长的 ci-triage Skill 片段,重点不是语法,而是结构:分类规则、已知失效模式、反模式、状态写回约定、eval suite。这个结构说明 Skill 不应只是静态说明书,而应包含“真实事故之后加进去的规则”。

---
name: ci-triage
description: Classify CI failures, draft fixes for easy ones, escalate the rest.
  Trigger on workflow_run.failure or on the morning triage routine.
---
 
# CI triage skill
 
## Classification rules
- env: missing secret, wrong env var. # escalate to human, never auto-fix
- flake: passes on retry without code change. # retry once, then file
- bug: deterministic failure tied to recent commit. # draft fix
- dependency: tied to version bump. # draft rollback
- infra: timeout, OOM, runner issue. # escalate
 
## Known failure modes # added by the loop over 14 days
- webhook-race: e2e checkout flakes when Stripe webhook arrives mid-test.
  Fix: add 2s settle delay in tests/utils/webhook.ts.
- tls-handshake: Windows runners fail TLS 1.2 in PowerShell. Use bash.
- db-migration: ALTER on trades table >1M rows times out at 30s. Batch in 10k chunks.
 
## Anti-patterns (do NOT do) # added after real incidents
- Never disable a failing test to make CI green. File it instead.
- Never modify .github/workflows/ without human approval.
- Never touch src/payments/ or src/billing/ without security review.
 
## State
Update STATE.md after each run with classifications, fixes drafted, escalations.
 
## Eval suite # step 13 — the loop verifies the skill
Run against eval/ci-triage-cases.jsonl weekly. Any newly-failing case →
add to known failure modes after Outcomes verifier confirms.

关键概念

  • Fable 5:适合担任自我改进系统编排者的 Mythos 级 Claude 模型。
  • 自我改进代理系统:模型不改权重、系统环境持续复利的 Agent 架构。
  • 验证者子代理:与制作者隔离上下文、只根据产出和评分标准判定是否通过的评估 Agent。
  • Claude Code:/goal、动态工作流、worktree、Skill、Routines 等能力的主要本地/托管入口。
  • Loop Engineering:目标、执行、验证、重试、预算和记忆构成的循环工程范式。
  • Skill:把经验、失败模式和程序性知识写成可复用能力包,是自我改进系统的程序记忆层。

与其他素材的关联

  • 2026-06-22-loop-engineering-woshipm 形成递进:此前素材解释 Loop Engineering 的六模块,本篇把 Loop 放进 Fable 5 的四层复利架构,强调验证者、状态文件和 Skill 写回。
  • 2026-06-29-27-hidden-claude-code-features 形成呼应:Rahul 的 Claude Code 技巧提到 Worktree、子代理、/loop 和上下文纪律,本篇将这些技巧升级为 Fable 5 数日级自治系统的基础原语。
  • 2026-07-01-woshipm-multi-agent-coding-pipeline 互补:多智能体流水线强调子代理 Brief、文件交接和验证证据,本篇进一步强调验证者要与制作者隔离,并可由低成本模型承担。
  • 2026-07-06-ltn-claude-code-skills-5 互补:前者强调高价值 Skill 要改变工作流程,本篇强调 Skill 还应吸收真实失败和 eval 结果,成为会复利的程序记忆。

原文精彩摘录

多數人使用 Claude Fable 5 的方式,就像在用一個 context window 更大的 Sonnet 4.6。他們丟一個提示,它跑了五分鐘,然後就把分頁關掉。十個使用者裡有九個,從來沒跑過一個「會複利」的代理系統:每一次執行都讓下一次更聰明、每一份狀態檔都在累積、每一個 Skill 都更鋒利。

「自我學習(Self-learning)」——代理根據所學更新自己的權重。Fable 5 不做這件事。沒有任何公開可用的模型在生產環境做這件事。遞迴自我改進(RSI)是 Anthropic 自己在 2026 年 5 月示警的長期方向,而不是今天出貨的能力。

「自我改進(Self-improving)」——代理周圍的系統在複利。每一次工作階段都把教訓寫進記憶。Skills 隨著邊角案例被加入而更鋒利。狀態檔累積已驗證的事實。Eval 迴圈精修提示與評分標準。模型本身不變,它運行所在的環境變得更銳利。

這個架構之所以複利:Layer 1 的每個輸出都向上流經 Layer 4,在那裡被評分、蒸餾,再寫回 Layer 3。明天在 Layer 1 的執行,會繼承昨天被磨利的記憶與精修過的 Skills。模型是無狀態的,它周圍的系統不是。

決定這份檔案是真的會複利、還是只是不斷膨脹的兩條操作規則:離開前先寫。每一次 Fable 5 工作階段都以更新 STATE.md 收尾——試了什麼、什麼通過、什麼失敗、有哪些新規則存活下來。如果工作階段沒有以一次寫入收尾,下一次就會從零重啟。

Fable 5 不是一個更快的聊天工具。它是一個會複利的系統的基底。第一個公開可用的 Mythos 等級模型,出貨不是為了被更快地提示。它出貨,是為了當你圍繞著它打造的那個自我改進系統的編排者。

相关页面