四小时发言实录刷屏背后,梁文锋的克制
把 梁文锋 四小时投资者交流里的高频词「克制」读成算力约束下的 AGI 概率最大化策略:砍旁支、追单位算力产出;并以 月之暗面 Kimi K3(KDA / 注意力残差 / 高稀疏 MoE)作为「通往 AGI 的第二条路」的验证样本,同时划清克制的边界——不能神化、不能替代基础科学重投入。
基本信息
- 来源类型:文章(人人都是产品经理 · 唐辰同学)
- 原文位置:
raw/articles/2026-07-23-woshipm-liangwenfeng-restraint-strategy.md - 原文 URL:https://www.woshipm.com/ai/6434514.html
- 抓取路径:
raw/extracts/20260724-015417/woshipm.com/page.md - Telegram stub:
raw/articles/2026-07-23-230902-tg-997f28.md - 发布日期:2026-07-23
- 消化日期:2026-07-24
- 互动口径(页头):约 611 浏览 · 1 评论 · 1 收藏 · 约 11 分钟阅读
- 文内免责:会议实录尚未得到梁文锋本人确认
核心观点
- 融资背景与「三不」转折:DeepSeek 完成成立以来首轮外部融资,文中口径总额超 500 亿元人民币(约 74 亿美元),投前估值约 3675 亿元(约 543 亿美元);此前梁文锋对外坚持「不融资、不上市、不商业化」。约 4 小时交流实录详述组织文化、开源逻辑、技术路线与竞争格局——与姊妹文 2026-07-23-woshipm-liangwenfeng-deepseek-other-half 同属「交流会刷屏」舆论场,但本篇重心在技术/战略范式而非股权穿透。
- 克制 = 战略,不是清高:高频「不」包括:不是天才、不赚不合理利润、不追求用户量、不闭源、不做 3D/视频生成/世界模型、不做下一个超级 App。作者反对仅把克制读成「资源不足的无奈」;更愿理解为在算力硬约束下,为 AGI 最大概率做的精密取舍——舍弃短期利益、砍非主线,把资源压在 CoT、Agent、持续学习等瓶颈。
- 中美差距的单一归因与硅谷范式对照:梁文锋断言人才/模型/应用差距「都可以认为是算力资源上的区别」。硅谷主流被概括为「资源溢出驱动涌现」:堆卡、训最大模型、做最全能力。作者指出其副作用——推理成本随能力/上下文/调用频次抬升;OpenAI 预计到 2030 年算力投入约 7500 亿美元(高于早前约 6000 亿规划)。Meta 多线(文本/多模态/元宇宙/机器人)导致核心大模型人才流失与节奏打乱;Google 在搜索/云/实验室目标拉扯下陷入「创新者窘境」——困境被归为技术以外的「战略贪婪」。
- DeepSeek 路线:单位算力效率 > 绝对规模:算力硬约束时,「做什么」重于「不做什么」;用工程能力补硬件代差。例:DeepSeek-V3 训练成本远低于 GPT-4o,性能逼近第一梯队。反例:MiniMax(闫俊杰)起步即押注文本/视频/语音/音乐四大模态,作者指其「颓势」让人为其捏一把汗——对照「少即是多」。
- Kimi K3 验证「第二条路」+ 产业链外溢:月之暗面 K3 总参约 2.8 万亿 MoE;靠 KDA(Kimi Delta Attention)混合线性注意力 + 注意力残差 + 高稀疏 MoE 重构生产效率——文中技术报告口径:KDA+MLA 混合下 KV 缓存最高减 75%、100 万上下文解码吞吐约 6×;注意力残差+高稀疏 MoE 训效约 +25%、额外成本 <2%;SemiAnalysis 称 KDA 推理速度 +300% 且长上下文近 Transformer。比喻:硅谷 Transformer 像「燃油车大力出奇迹」,KDA 像「混动热效率」。开发者侧已用「模型路由」按任务选成本/效率最优模型(含中国模型)。上游倒逼国产芯片重编译器/互联/系统能效而非只比峰值;下游降低中小企业与垂直场景(医疗/教育/工业质检)入场门槛。
- 边界:克制不能教条化:基础科学与超大规模预训练仍需重金;不能神化 DeepSeek/Kimi 路径。FOMO 下「Sora 热做视频、具身热造机器」时,聚焦本身可能是另一种「快」。
实操内容保留
(本文为战略评论,无产品操作代码。以下保留可复用的对照表与判断清单。)
两条 AGI 范式对照(文中框架)
| 维度 | 硅谷「资源溢出」 | DeepSeek / Kimi「效率」 |
|---|---|---|
| 驱动 | 堆卡、最大模型、最全能力 → 涌现 | 算力硬约束下单位算力 / 每瓦特智能产出 |
| 组织风险 | 多线并行 → 战略贪婪、熵增 | 砍 3D/视频/世界模型/超级 App 等旁支 |
| 主线举例 | 全栈模态与应用叙事 | CoT、Agent、持续学习 |
| 样本 | OpenAI 算力开支规划上修;Meta/Google 多目标拉扯 | V3 低训本近顶;K3 KDA 等效率重构 |
| 市场反应 | 华尔街质疑回报与美方领先 | 模型路由「用脚投票」中国模型 |
Kimi K3 效率数字卡(文中口径,非官方审计)
| 指标 | 数值 / 说法 |
|---|---|
| 总参数 | 约 2.8 万亿(首款 3 万亿级 MoE 口径) |
| 关键技术 | KDA 混合线性注意力、Attention Residuals、高稀疏 MoE |
| KV 缓存 | 最高削减约 75%(KDA+MLA 混合实验) |
| 长上下文解码 | 100 万上下文解码吞吐约 6× |
| 训练效率 | 约 +25%,额外成本 <2% |
| 推理速度(SemiAnalysis) | KDA 约 +300%,长上下文近 Transformer |
| 预算隐喻 | 同预算「1 任务 → 4 任务」且质量不打折 |
读「克制 / 效率」叙事时的追问清单
- 砍掉的是旁支还是护城河?(视频/世界模型是否永远非主线)
- 数字来源是否可复核?(实录未本人确认;SemiAnalysis / 技术报告二手转述)
- 效率红利落在谁?(芯片编译器、模型路由、中小企业推理成本)
- 边界在哪?(基础科学/超大规模预训练是否仍要重投入)
- 与治理叙事是否同读?(见姊妹文:克制话术 vs 控股与幻方现金机)
操作步骤
(本文无分步教程。)
关键概念
- 梁文锋 — 交流会叙事主体;将克制定义为 AGI 概率策略
- DeepSeek — 「三不」转折后的首轮融资与效率路线样本;V3 低成本近顶
- 月之暗面 — Kimi K3 被当作 DeepSeek 路线的并行验证
- MiniMax — 四模态并行的反例(文中「颓势」判断,口径主观)
- OpenAI — 2030 算力投入约 7500 亿美元的开支上修样本
- 多模型路由 — 开发者按任务选成本/效率最优模型的「用脚投票」
- Kimi K3 / KDA / 注意力残差 / 高稀疏 MoE — 效率重构技术栈(纯文本,未单建实体)
- 韬定律 / 每瓦特智能产出比 — 文中借用的能效隐喻(纯文本)
- 资源溢出驱动涌现 vs 战略贪婪 — 硅谷范式及其组织代价(纯文本)
- AGI / CoT / Agent / 持续学习 — 被点名为应聚焦的瓶颈(旁链 Steps to AGI 分级 可参考)
与其他素材的关联
- 姊妹篇对照 2026-07-23-woshipm-liangwenfeng-deepseek-other-half:同场「交流会刷屏」——本篇把克制读成效率/聚焦战略并部分肯定;姊妹篇把克制读成可被高明商业策略包装的话术,并展开幻方现金机与 84% 控股。应并读,勿只取一边。
- 与 AI商业化趋势 / 2026-06-19-woshipm-ai-commercialization-endgame:呼应「第一性原理是算力」——本篇补上中美算力差 → 效率范式 → 模型路由与产业链成本重塑链条。
- 与 2026-07-15-woshipm-ai-competition-6-trends / 多模型路由:任务总成本与路由分层——本篇给出 K3 与「用脚投票」的叙事侧证据。
- 与 2026-07-15-woshipm-tencent-hunyuan-hy3:自研模型「成本锚点 / 性价比曲线」——本篇从 DeepSeek/Kimi 侧写「不必挤硅谷赛道」。
- 与 2026-06-18-2026-ai-narrative-definition-power:月之暗面「技术换增长」、MiniMax「效率定价」叙事——本篇用 K3 技术细节与四模态反例再加压。
- 与 2026-06-10-kimi-k25-video2code-frontend / Kimi K2.5:产品能力线(Video2Code)vs 本篇基座效率线(K3/KDA)——同属 Moonshot 族谱不同切面。
原文精彩摘录
梁文锋花了很大篇幅对投资者强调,克制是一种战略。舍弃短期利益,砍掉非主线业务,不是为了显得清高,而是为了换取实现AGI的最大概率。……他说了非常多次的「不」:不是天才,不赚不合理的利润、不追求用户量、不闭源、不做3D / 视频生成 / 世界模型,不做下一个超级App。
他在谈及中美差距时断言,「我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。」……硅谷AI的范式是「资源溢出驱动涌现」。……这些巨头的困境,多来自技术以外的「战略贪婪」。
根据月之暗面此前发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用最高削减75%,100万上下文长度下的解码吞吐量提升至原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提升约25%,额外成本不到2%。这意味着同样一笔算力预算,过去只能跑1个任务,K3能跑4个,且质量不打折。
但我们也需要认识到,克制是一种战略,也就要有边界。……更不能神化DeepSeek、Kimi 的发展路径,将克制教条化。……奔赴AGI,我们能不能允许自己慢一点,少追逐一些边缘诱惑?……聚焦一下,也可能是另外一种「快」。