腾讯AI,翻身了吗?(混元 Hy3 与腾讯 AI 战略复盘)
混元 Hy3 不是最强模型,但用”工程型、性价比、Agent 倾向”的定位让腾讯重回开发者候选清单;腾讯真正补上的是”造模型的方法”,而未来天花板取决于混元能否连续迭代 + 微信原生 Agent 能否落地。
基本信息
- 来源类型:文章(人人都是产品经理 · 定焦One,作者陈丹 / 编辑魏佳)
- 原文位置:raw/articles/2026-07-15-000639-tg-9e222f.md
- 原文 URL:https://www.woshipm.com/ai/6428913.html
- 同文重复来源:raw/articles/2026-07-15-000704-tg-602f71.md(同一篇文章经 https://www.woshipm.com/it/6428504.html 二次抓取,内容一致,已合并去重,不单独建页);raw/articles/2026-07-15-000717-tg-6278ad.md(同一篇文章经 https://www.woshipm.com/it/6428509.html 三次抓取,内容一致,已合并去重,不单独建页)
- 消化日期:2026-07-15
核心观点
-
Hy3 不追求参数极致,走工程化 + 性价比路线:混元 Hy3 于 2026-07-06 低调发布正式版,采用 MoE 架构,总参数 2950 亿、单次推理只激活约 210 亿参数,支持 256K 上下文。同期竞品 DeepSeek V4 Pro(万亿级)、智谱 GLM-5.2、MiniMax M3 都在争能力上限,Hy3 没有在每项指标上压倒对手,而是在模型容量、运行速度和算力成本之间找平衡。
-
能力处于”第二梯队上沿、开放与低成本模型第一梯队”:SWE-bench Verified 得 78 分(落后 Claude Fable 5、GLM-5.2、DeepSeek V4 Pro),但难度更高的 SWE-bench Pro 以 57.9 分反超 DeepSeek V4 Pro,WildClawBench 超过 GLM-5.1 和 DeepSeek V4 Pro。资深 Agent 从业者赵江杰判断:前端开发、常规代码、搜索浏览、工具调用有较强竞争力,高频、中低难度、结果可验证的任务能独立完成,但核心架构设计和敏感操作仍不适合无监督交付。
-
发布后开发者侧反响强烈,但数据需谨慎看待:上线三天(限时免费阶段)升至 OpenRouter 最受欢迎模型榜第八;接入腾讯办公智能体 WorkBuddy 后调用量冲高、排队率一度超 50% 被迫紧急扩容;发布当天腾讯股价上涨 4.82%。Preview 发布后日均 Token 消耗增长 20 倍、WorkBuddy 主动选择该模型的用户增长 6 倍。但这些增长可能受限免、积分和内部导流影响,真正考验要等免费期结束。
-
腾讯真正补的是”造模型的方法”,而非某一款模型:混元 2023 年就已发布,但两年里”场景很多、大模型不行”。转折点是 2025 年 9 月姚顺雨从 OpenAI 加入、12 月任首席AI科学家并重组研发体系——模型、算力、数据、评测被纳入更集中的决策链,先重做预训练/强化学习系统、清洗数据、调整后训练流程,把真实产品反馈、人工盲测、内部任务纳入评测,坚持模型与产品深度 Co-Design、多产品数据回流。
-
腾讯 AI 天花板取决于两条线:连续迭代的模型 + 微信原生 Agent:腾讯手握 14 亿微信月活入口、身份权限体系、小程序工具生态、支付交易能力、企业微信组织流程和云基础设施,在”模型-入口-工具-交易”链路上比阿里/字节/DeepSeek/智谱更完整。但理论优势还没变现——微信原生 Agent”小微”仍在灰度测试,能否调动小程序、调用支付、完成交易尚无答案。赵江杰把自研模型的战略价值概括为:成本锚点、供应安全、产品共训、私有化合规、持续学习能力,以及参与下一代技术竞争的资格。
实操内容保留
(本文为行业分析 / 战略复盘类文章,无实操代码、Prompt 模板或分步教程。)
关键量化数据速查(可作为国产模型横评参考):
| 维度 | 混元 Hy3 数据 |
|---|---|
| 架构 / 总参数 | MoE / 2950 亿 |
| 单次激活参数 | 约 210 亿 |
| 上下文长度 | 256K |
| SWE-bench Verified | 78 分(落后 Claude Fable 5 / GLM-5.2 / DeepSeek V4 Pro) |
| SWE-bench Pro | 57.9 分(反超 DeepSeek V4 Pro) |
| WildClawBench | 超过 GLM-5.1 和 DeepSeek V4 Pro |
| 不同 Agent 框架准确率波动 | 控制在 4% 以内 |
| OpenRouter 上线三天排名 | 最受欢迎模型榜第八(限免) |
| OpenRouter 7 月编程模型使用量 | 前四(与 GLM-5.2 / MiniMax M3 / DeepSeek V4 系列相近梯队) |
| WorkBuddy 排队率峰值 | 超 50% |
关键概念
- 混元Hy3 — 本文主角,腾讯低调发布的旗舰 MoE 模型,工程型 / 性价比 / Agent 倾向定位
- 姚顺雨 — 前 OpenAI 研究员,2025 年加入腾讯任首席AI科学家,重组混元研发体系的标志性人物
- DeepSeek — 文中多次作为横评对手(V4 Pro),Hy3 在 SWE-bench Pro / WildClawBench 上反超
- 智谱 — GLM-5.2 / GLM-5.1 为文中主要国产对标,盲测中 Hy3 整体高于 GLM-5.1
- MiniMax — M3 与 Hy3 处于相近的 OpenRouter 调用梯队
- Kling — 文中”可灵”,腾讯参与其最高 30 亿美元融资
- 元宝 / CodeBuddy / ima / Marvis — 腾讯接入 Hy3 的产品矩阵(暂未建实体页)
- 腾讯 WorkBuddy(办公智能体)— 腾讯自家办公 Agent,本文的 WorkBuddy 与知识库既有 WorkBuddy(PM Skill 平台)不是同一产品,此处不建链接
- 性价比曲线 — 腾讯首席战略官詹姆斯·米切尔提出,Agent 按任务能力与成本约束自主选模型,腾讯要”成为其中一员,而不是唯一选择”
与其他素材的关联
- 与 2026-06-09-woshipm-to-a-era 的关系:To A 论指出 Agent 时代流量入口重构、大厂争”被 Agent 调用而非被绕过”;本文的”微信原生 Agent 小微”、“模型-入口-工具-交易”链路正是腾讯在 To A 竞争里的具体落子,两者互为宏观判断与个案。
- 与 2026-06-19-woshipm-ai-commercialization-endgame 的关系:终局论提出 AI 第一性原理是算力、成本结构决定商业模式;本文的”成本锚点""性价比曲线""激活参数少≠真实成本低”是同一逻辑在自研模型战略上的延伸。
- 与 2026-06-18-2026-ai-narrative-definition-power 的关系:智谱靠逆势涨价验证定价权、把 API 当最佳商业模式;本文中腾讯走的是相反路径——用自研模型做”成本锚点 + 供应安全 + 产品共训”,模型不拿去和别人拼胜负而是当”不能没有的底盘”。
原文精彩摘录
“如果’赶上’意味着成为能力最强的国产模型,Hy3 还没有做到;但如果意味着重新进入开发者的视野,腾讯已经重新拿到了一张入场券。”
“过去两年,腾讯真正缺的,是一套能够稳定造出模型、让模型进入产品,再让产品反馈推动模型继续进化的方法。Hy3 暂时证明,这套循环开始重新运转,但一次成功还不足以证明腾讯已经建立起长期竞争力。”
“一款能力只有 90 分,却能以较低成本、安全地调用微信身份、小程序、企业流程和支付系统的模型,可能比一款能力达到 100 分、却只能返回文本的外部模型更有商业价值。“