混元Hy3
腾讯 2026-07-06 低调发布的旗舰 MoE 模型,不追求参数极致,以”工程型、性价比突出、Agent 倾向明显”的定位让腾讯重回开发者候选清单
简介
混元 Hy3 是腾讯混元系列的旗舰大模型正式版,于 2026 年 7 月 6 日发布。它没有开发布会、没有铺天盖地的营销,以不太符合大厂惯例的低调方式进入市场,却在开发者一端激起不小水花:上线三天(限时免费阶段)升至 OpenRouter 最受欢迎模型榜第八,接入腾讯办公智能体 WorkBuddy 后调用量迅速冲高、排队率一度超 50%,发布当天腾讯股价上涨 4.82%。
与同期争夺能力上限的国产模型不同——DeepSeek V4 Pro 把总参数推至万亿级、智谱 GLM-5.2 把上下文拉到 100 万 Token、MiniMax M3 在长程 Agent 任务占优——Hy3 总参数 2950 亿、支持 256K 上下文,并没有试图在每项指标上压倒对手。它的真实定位被市场概括为”一款工程型、性价比突出、Agent 倾向明显,但复杂认知任务还不够均衡的模型”,而不是一款全面领先的通用模型。Hy3 是腾讯重组混元研发体系(由 姚顺雨 主导)之后交出的第一批结果。
关键信息
- 类型:模型(大语言模型 / 旗舰款)
- 领域:大语言模型 · 代码与 Agent
- 厂商:腾讯(混元团队)
- 发布日期:2026-07-06(正式版)
- 架构:MoE(混合专家),总参数 2950 亿,单次推理只激活约 210 亿参数
- 上下文长度:256K
- 定价/开放状态:发布初期在 OpenRouter 限时免费
- 相关概念:姚顺雨、DeepSeek、智谱、MiniMax、Kling、AI商业化趋势
核心特性
定义与定位
Hy3 是一款以工程化落地和成本控制为核心诉求的旗舰模型。它没有不断堆高峰值能力,而是在模型容量、运行速度和算力成本之间寻找平衡。更少的激活参数(210 亿 / 2950 亿)意味着它具备降低推理开销和部署门槛的架构基础——但激活参数少并不天然等于真实成本低,模型效率还取决于硬件、量化方式、推理框架、上下文长度、输出长度、并发规模和任务成功率。
能力边界(横评数据)
- SWE-bench Verified:78 分,落后于 Claude Fable 5 等闭源模型,也排在 GLM-5.2 和 DeepSeek V4 Pro 之后
- SWE-bench Pro(更高难度):57.9 分,反超 DeepSeek V4 Pro
- WildClawBench(接近真实执行环境):超过 GLM-5.1 和 DeepSeek V4 Pro,位居开放模型前列
- 腾讯 270 名专业人员盲测:整体高于 GLM-5.1,优势集中在前端开发、数据存储和持续集成
- 能力梯队(赵江杰判断):整体能力第二梯队上沿、开放与低成本模型第一梯队;高频、中低难度、结果可验证的任务能独立完成,中等复杂任务可执行后复核,核心架构设计和敏感操作仍不适合无监督交付
稳定性与工程指标
- 在不同 Agent 框架下运行 SWE-bench Verified 时,准确率波动被控制在 4% 以内
- 内部场景中,幻觉率和多轮对话问题率明显下降
- 企业需要的不是偶尔表现惊艳,而是几十次连续调用中少出错、不失忆、不中断——稳定性本身是成本的一部分
适用场景
适合前端开发、常规代码、搜索浏览、工具调用等高频且结果可验证的任务;腾讯已将 Hy3 接入元宝、CodeBuddy、ima、Marvis 和办公智能体 WorkBuddy,用于生成文档、制作表格、编辑文件、管理电脑和编排工作流。不适合直接无监督交付核心架构设计和敏感操作。
不同素材中的观点
- 2026-07-15-woshipm-ai-competition-6-trends:这篇素材把 Hy3”只激活 21B 参数就在部分 Agent 和办公任务上打平旗舰”当作模型同质化与”评价从参数榜单转向任务总成本”两大趋势的核心论据。它强调 Hy3 是”高效架构 + 超级 App 分发”的代表——总参数 295B、激活 21B(MoE),普通白领工作已基本够用、性价比拉满,还塞进微信生态,被形容为”腾讯悄无声息的王炸:能力够用、入口巨大、成本可控”。文章据此得出”参数规模已经不是模型的炫耀点”的判断,用户和企业更关心”干一件事总共花多少钱、成功率多少、用起来顺不顺”。
- 2026-07-15-woshipm-ai-competition-6-trends:这篇素材把 Hy3(文中写作总参数 295B、激活 21B)当作两个趋势的典型代表:其一,它靠 21B 激活参数就在部分 Agent 和办公任务上打平旗舰,证明模型同质化时代”后来者几个月就能追上第一梯队”;其二,它”高效架构 + 超级 App 分发(微信生态)“的组合让普通白领工作基本够用、性价比拉满,印证了”模型评价从参数榜单转向任务总成本”——参数规模不再是炫耀点,用户更关心干一件事总共花多少钱、成功率多少、顺不顺。文章还把 Hy3 从腾讯 50+ 产品反馈迭代列为”模型-产品-数据闭环”护城河的案例。
- 2026-07-15-woshipm-tencent-hunyuan-hy3:这篇素材认为 Hy3 更像一个”阶段性信号”而非终局——它没有证明腾讯拥有最强模型,但证明腾讯重新拥有了一款”能用的模型”,让外部开发者愿意主动试用、内部产品开始把真实任务交给它。文章特别提醒 Hy3 的热度数据需谨慎看待:OpenRouter 限免、WorkBuddy 调用增长可能受积分/限免/内部导流影响,真正考验要等免费期结束;腾讯目前证明的是 Hy3”有降低成本的可能性”,但在统一条件下还需验证首 Token 延迟、吞吐量和成功任务成本是否真的更优。
实用信息
- 快速上手:发布初期可在 OpenRouter 上调用 Hy3(限时免费);腾讯自家产品(元宝、CodeBuddy、WorkBuddy 等)已内置该模型
- 选型建议:把它当”工程型 + 性价比 + Agent 倾向”的模型使用,适合高频、中低难度、结果可验证的代码与工具调用任务;复杂认知任务和敏感操作保留人工复核
- 避坑提示:激活参数少不等于真实成本低,落地前应在统一条件下实测首 Token 延迟、吞吐量、并发规模和任务成功率;发布初期的榜单与调用量受限免影响,别把限免期数据当稳态