Ornith 1.0
DeepReinforce 于 2026 年 6 月发布的开源 Agent 向模型系列,本文重点涉及 35B MoE 版本:以约 3B 激活参数承担推理、支持长时间项目型代码任务,并可通过 vLLM 接入 Hermes Agent。
简介
Ornith 1.0 是 DeepReinforce 发布的开源模型系列,定位不是泛泛的聊天模型,而是面向 AI Agent 使用场景的 refined models。素材中提到,该系列通过强韧学习增强 Gemma 4 与 Qwen 3.5 体系而来,四种模型规格都可在 MIT 授权下使用;已公开的规格包括 9B dense、35B MoE 与 397B MoE,另有 31B dense 当时尚未发布。
本文最重要的版本是 Ornith-1.0-35B MoE。作者此前用 Gemma 4 26B 搭建 Hermes local LLM,但觉得代码能力与商业云端模型仍有差距,于是转向 Ornith。35B MoE 的关键价值在于:总参数量足够大,但单次只需计算约 3B 参数,因此更适合在本地 GPU 上承担高频 Agent 交互;同时它被描述为具备长时间连续推理能力,能完成项目型代码开发,而不只是短问答。
与 Ollama 上常见的小模型不同,Ornith 35B MoE 在素材中被放进完整本地 Agent 系统里验证:vLLM 负责 OpenAI 兼容服务,Hermes Agent 负责工具调用和任务编排,Supermemory 负责本地记忆,Qwen VL 3B / local firecrawl 则补充视觉与网页擷取能力。这使 Ornith 1.0 更像本地 Agent 的“推理引擎”,而不是单独运行的模型文件。
关键信息
- 类型:开源大语言模型 / Agent 向模型系列
- 发布方:DeepReinforce
- 发布时间:2026 年 6 月
- 重点版本:Ornith-1.0-35B MoE
- 授权状态:素材称四种模型规格皆可通过 MIT 授权使用
- 相关技术:Qwen 3.5、Gemma 4、MoE、vLLM、OpenAI 兼容接口、tool call parser、reasoning parser
- 适用场景:本地 AI Agent、Hermes Agent 自定义模型、项目型代码开发、工具调用、多轮浏览器验证
- 相关概念:Hermes Agent、vLLM、Supermemory、AI编程开发
核心特性
1. MoE 架构降低单次推理负载
35B MoE 版本的核心优势是“看起来很大,但每次不全算”。素材明确列出三个选择理由:推理速度较快,因为仅需计算 3B 参数而不是全部 35B;单次记忆体使用较低,适合在 GPU 上运行;具备长时间连续推理能力,可完成项目型态的程式开发。对于本地 Agent,这三点比单次 benchmark 更重要,因为 Agent 需要持续调用工具、读写代码、运行测试和修正错误。
2. 适合作为 Hermes 的 custom provider
Ornith 不是通过专用客户端接入 Hermes,而是由 vLLM 暴露 OpenAI 兼容接口,再在 Hermes 中用 hermes model setup 选择 provider 为 custom、模型名为 Ornith-1.0-35B。这条路径的价值是把模型运行、Agent 编排和记忆系统解耦:只要本地服务保持 OpenAI API 形态,Hermes 和 Supermemory 都可以复用它。
3. 支持工具调用和推理解析配置
素材特别强调部署时 tool-call-parser 与 reasoning-parser 都要使用 qwen。示例脚本设置了 --enable-auto-tool-choice、--tool-call-parser qwen3_xml 和 --reasoning-parser qwen3。这说明本地模型用于 Agent 时不能只看“能否聊天”,还要看模型输出的工具调用格式能否被服务端正确解析,否则 Agent 会卡在“会说但不能行动”。
4. 长上下文与低延迟兼顾
示例 vLLM 参数把最大模型长度设为 131072,并开启 --enable-prefix-caching。测试中 TTFT 约 0.15 秒、TPS 约 25 token/s。对 Hermes 这类交互式 Agent 而言,低首字延迟意味着人机对话感觉顺滑,长上下文和 prefix caching 则有利于连续项目开发、工具回传和代码上下文保持。
5. 多模态能力需要实机验证
素材中一个重要但谨慎的观察是:Ornith 1.0 35B MoE 官方文件未特别说明多模态,但作者在 Hermes Agent v0.17.0 中把 Image Routing 设为 Auto 后,在无外网、无第三方 API key 的情况下仍可快速解析影像,体验接近 Gemma 4 多模态模型;但 FP8 版本曾无法使用 image input。因此,Ornith 的多模态能力不能只看模型名或格式,而要按具体量化版本、Hermes 路由和视觉引擎组合实测。
不同素材中的观点
- 2026-07-08-vocus-hermes-ornith-local-llm-agent:这篇素材把 Ornith 1.0 放在本地 AI Agent 系统中评估,而不是孤立比较模型分数。它认为 35B MoE 是当前 Hermes local LLM 的最佳选择,理由是代码能力接近商业云端模型、Terminal-Bench 2.1 表现强、单次只激活约 3B 参数、能支撑长时间连续推理。文章还用踩地雷小游戏任务验证其工具调用、浏览器检查、代码撰写和多轮修改能力。
实用信息
- 安装方式:用 vLLM OpenAI 容器部署,挂载 Hugging Face 模型缓存目录,模型 handle 由
${HF_MODEL_HANDLE}提供,served model name 固定为Ornith-1.0-35B。 - 基本用法:本地服务启动后,通过
http://localhost:8000/v1/chat/completions发送 OpenAI 兼容请求;Hermes 中 provider 设置为custom,model 设置为Ornith-1.0-35B。 - 关键参数:
--max-model-len 131072、--gpu-memory-utilization 0.8、--enable-prefix-caching、--enable-auto-tool-choice、--tool-call-parser qwen3_xml、--reasoning-parser qwen3。 - 适用场景:有较大 CUDA 共享显存、希望减少第三方 API 依赖、需要本地 Agent 做项目型代码开发和工具调用的用户。
- 注意事项:FP8 版本可降低显存占用、增加同时使用者,但 image input 不一定可用;若要保留视觉能力,可单独加入 Qwen VL 3B 作为 local vision analysis engine,并实际测试 Hermes Image Routing。