Hermes Agent 加上 Ornith 本地模型:超效能的 local LLM AI Agent
这篇素材展示了一条“本地模型 + Agent 框架 + 本地记忆”的完整链路:用 vLLM 部署 Ornith-1.0-35B MoE,再接入 Hermes Agent 和 Supermemory,让本地 AI Agent 在无第三方 API key 的情况下完成代码开发、工具调用、浏览器检查与视觉理解。
基本信息
- 来源类型:文章
- 原文位置:raw/articles/2026-07-08-085807-tg-a1ce9c.md
- 原文 URL:https://vocus.cc/article/6a4724d7fd89780001371b6f
- 消化日期:2026-07-08
核心观点
- Ornith 1.0 35B MoE 被作者选为本地 Hermes Agent 的最佳模型:素材认为 Gemma 4 26B 的程式能力与商业云端模型仍有差距,而 DeepReinforce 2026 年 6 月发布的 Ornith-1.0 在多项测试中接近著名模型,甚至在 Terminal-Bench 2.1 上超越 Claude Opus 4.7;四种模型规格均可 MIT 授权使用,其中 35B MoE 因只需计算约 3B 激活参数、显存占用较低、适合长时间连续推理,成为具备 128GB 共享 CUDA GPU 环境下的首选。
- 本地 Agent 的关键不是只跑模型,而是把模型接成 OpenAI 兼容服务:作者用
vllm/vllm-openai:latest容器部署 Ornith-1.0-35B,设置--served-model-name Ornith-1.0-35B、--max-model-len 131072、--enable-auto-tool-choice、--tool-call-parser qwen3_xml、--reasoning-parser qwen3,让 Hermes 可以把它当作 custom provider 调用。这说明本地模型要成为 Agent 后端,必须同时解决服务协议、工具调用解析、上下文长度、前缀缓存和显存利用率。 - 性能体验已经足够支撑交互式 Agent 开发:测试中 Ornith-1.0-35B 的首字延迟(TTFT)约 0.15 秒,平均生成速度约 25 token/s;接入 Hermes 后,作者让它创建浏览器版踩地雷小游戏,并要求自行启动 web server、使用 browser 工具检查输出、测试按键功能、说明修改原因,最终完成游戏与服务器。这证明本地 MoE 模型已能支撑较长链路的工具调用、代码生成、浏览器验证和迭代修改。
- Hermes + Supermemory 让“本地 AI Agent”从模型推理扩展到长期工作系统:Hermes 端只需通过
hermes model setup把 provider 设为custom、模型名设为Ornith-1.0-35B;Supermemory 端则在.supermemory/.env中把OPENAI_MODEL改成同名模型后重启。这样模型、Agent、记忆系统都在本地运行,减少外部 API 依赖,并为持续项目型开发提供上下文积累。 - 本地多模态和并发用户数仍需要工程取舍:作者发现 Ornith 35B 安装在 Hermes Agent v0.17.0 后,在 Image Routing 设为 Auto、无外网和无第三方 API key 的情况下仍能快速解析影像,体验接近 Gemma 4 多模态模型;但 FP8 版本曾无法使用 image input。为了增加同时使用者,作者最终改用 Ornith 35B FP8(memory-utilization 0.55),同一 Docker 再加 Qwen VL 3B 作为 local vision analysis engine(memory-utilization 0.12),并利用剩余 VRAM 安装本地 firecrawl 提升网页内容擷取效率。
实操内容保留
代码/配置
vLLM OpenAI 兼容容器部署脚本:
docker pull vllm/vllm-openai:latest
docker run -v /home/andytsen/vllm_deploy/models:/root/.cache/huggingface \
-d --gpus all -p 8000:8000 --name ${CONTAINER_NAME} \
vllm/vllm-openai:latest \
${HF_MODEL_HANDLE} \
--served-model-name Ornith-1.0-35B \
--max-model-len 131072 \
--gpu-memory-utilization 0.8 \
--max-num-batched-tokens 4096 \
--enable-prefix-caching \
--trust-remote-code \
--enforce-eager \
--enable-auto-tool-choice \
--tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--tensor-parallel-size 1 \
--default-chat-template-kwargs '{"enable_thinking": false}'本地 OpenAI 兼容接口测试脚本:
import requests
url = "http://localhost:8000/v1/chat/completions"
payload = {
"model":"Ornith-1.0-35B",
"messages": [{"role": "user", "content": "你好,請用繁體中文介紹你自己"}]
}
response = requests.post(url, json=payload)
print(response.json()['choices'][0]['message']['content'])Supermemory 模型配置:
OPENAI_MODEL=Ornith-1.0-35BPrompt 模板
Hermes 游戏开发测试 Prompt:
請創作一個可以在瀏覽器上使用的踩地雷的小遊戲, 創作過程中請自行啟動 web server 檢查輸出結果,自行修改;修改過程請顯示修改原因;完成之後通知我。 踩地雷遊戲規則與操作 左鍵點擊 :翻開方塊。若點到地雷即遊戲結束;若為數字,則代表周圍(包含斜角)隱藏的地雷數量。 右鍵標記 :在疑似地雷的方塊上按右鍵可插上小旗幟。 雙擊數字 :當翻開的數字與周圍已標記的旗幟數量相同時,同時點擊左右鍵可以快速翻開該數字周圍其餘未翻開的格子。
操作步骤
- 用 Docker 拉取并启动
vllm/vllm-openai:latest,将 Hugging Face 模型缓存目录挂载到容器内。 - 在 vLLM 启动参数中把 served model name 固定为
Ornith-1.0-35B,并设置长上下文、显存利用率、prefix caching、tool call parser 与 reasoning parser。 - 用本地
http://localhost:8000/v1/chat/completions接口发起 OpenAI 兼容测试,确认模型名与服务响应可用。 - 在 Hermes 中执行
hermes model setup,将 provider 设为custom,模型名称设为Ornith-1.0-35B。 - 在
.supermemory/.env中设置OPENAI_MODEL=Ornith-1.0-35B,然后重启 Supermemory。 - 用带工具调用、浏览器验证和多轮修改要求的任务(如踩地雷小游戏)测试本地 Agent 是否具备项目型开发能力。
- 若需要增加同时使用者,可降低 Ornith 35B FP8 的 memory utilization,并在同一 Docker 中加入 Qwen VL 3B 作为 local vision analysis engine;但需单独验证 image input 是否正常。
关键概念
- Hermes Agent — 本文中的 AI Agent 运行框架,负责接入自定义模型、执行工具调用、启动浏览器检查和承接项目型任务。
- Ornith 1.0 — 本文的本地代码/Agent 模型后端,35B MoE 版本以低激活参数、长推理和工具调用能力为核心卖点。
- vLLM — 把 Ornith 部署为 OpenAI 兼容服务的推理服务器,负责长上下文、显存管理、prefix caching 和 tool call parser。
- Supermemory — 本地 Agent 的长期记忆层,通过配置模型名接入同一个本地 OpenAI 兼容服务。
- AI编程开发 — 本文归属的主题:本地 Agent 编程、代码生成、浏览器验证和工具调用工程化。
与其他素材的关联
- 与 2026-06-03-hermes-agent-setup-guide 的关系:前者主要介绍 Hermes 的自我进化、Cron、Telegram 与 VPS 部署定位;本文补上“本地模型后端”这一层,让 Hermes 不再只依赖云端模型或订阅额度。
- 与 2026-06-17-cc-switch-7-cli-console 的关系:CC Switch 把 Hermes 放在多 AI CLI 配置管理生态里;本文则进入 Hermes 内部的模型供应层,说明 custom provider 如何接入本地 vLLM 服务。
- 与 2026-07-06-unwire-studio0808-livecaption-ai-subtitle 的关系:两者都强调本地 AI 的价值,但前者是浏览器影音字幕翻译场景,本文是本地 Agent 编程与多模态工具调用场景。
- 与 AI编程开发 中“本地部署 + 云端混合方案”的关系:本文把本地模型从简单 IDE 辅助推进到可运行 Hermes Agent、Supermemory、vision analysis engine 和 firecrawl 的完整本地工作系统。
原文精彩摘录
在前面我們使用 Gemma 4 26B 的模型來建立 Hermes agent 的 local LLM 模型,同時使用 local supermemory 完成全面獨立的 local AI Agent 系統;不過 Gemma 4 模型的程式能力其實相較於商用的雲端模型來說,確實有一些差距。最近一家新創的公司 ” DeepReinforce ” 在 2026 年 6 月發布了 Ornith-1.0 開源模型,在他們的多項測試中能力都與著名的模型相當接近,甚至在 Terminal-Bench 2.1 測試上超越了 Claude Opus 4.7。
要注意的是 model 要設為 “Ornith-1.0-35B”,它的首字延遲 (TTFT) 約是 0.15 秒,平均生成 (TPS) 約在每秒 25 token;作為 Hermes agent 的模型,使用上相當順暢。
它就會自己把遊戲以及 web server 寫出來、調用 browser 工具 (nevigate, vision) 檢查、測試按鍵功能、修改;最後再請你去查收成果;有很順暢的工具調用以及長時間程式撰寫、修改能力。
為了要增加同時使用者的人數,最後我還是改用 Ornith 35B FP8 (memory-utilization 0.55),然後在同一個 docker 再加上一個 Qwen VL 3B 作為一個 local vision analysis engine (memory-utilization 0.12)。改了之後,因為 VRAM 還有很大的空間,所以也在同一個 docker 上裝上了 local 的 firecrawl;在網頁內容擷取就非常有效率。