搞懂AI怎么学习的,我反而想通了自己是怎么活的
5 个 AI 前沿研究发现(视频生成、机器人纠错、失败重贴标签、抽象能力倒U型、提示词驱动探索),每个都揭示了一种比算法更普遍的人类认知规律——AI 的学习逻辑与我们摸索着怎么跟世界相处的规律,是同一件事的两种说法。
基本信息
- 来源:人人都是产品经理
- 作者:千江月、楊yang
- 日期:2026-07-16
- 原始 URL:https://www.woshipm.com/zhichang/6430456.html
- 类型:网页文章
核心观点
-
能造出来,才算真懂:视频生成模型为了生成符合物理规律的动态画面,被逼着在脑内建立了一套对三维空间和物理规则的理解。研究发现,把训练好的视频生成 AI 改去干视觉感知任务(深度估计、物体抠图、3D 骨骼识别),成绩竟与专门为此训练的顶级模型不相上下,且只用别人一小部分训练数据——说明它不是死记硬背图案,而是学到了可迁移的底层规律。这验证了费曼的名言:“What I cannot create, I do not understand”(凡是我不能亲手创造的东西,我就没有真正理解它)。对于产品经理:判断是不是真学会了一个东西,标准不是能不能看懂、能不能点头,而是能不能用自己的话把它重新讲一遍、重新搭一遍。
-
顶级的纠错是改念头,不是掰胳膊:纠正 AI 机器人的传统方法要么从头重训(成本高、易遗忘旧技能)、要么强行干预(动作僵硬、打断原有顺畅逻辑)。论文的方法更聪明——机器人每次动作前会先产生一个”潜在空间噪声”(念头),工程师用反向计算倒推出”如果做出了正确动作,当初应该产生什么念头”,再训练一个轻量级的意识小模型在下一次悄悄递给机器人。结果只需纠正几次到十几次就能学会新技能,且因为主脑没被改过,原本会的技能全都没忘。对管理的启发:不要逐条改下属的方案(等于掰胳膊),而要找到他做这件事最开始的那个念头、帮他掰正理解——他自己自然会把后续所有细节做对。
-
失败只是一次标错了位置的成功:机器人训练面临”稀疏奖励困境”——99% 的尝试都是失败的,一次都做不对就拿不到正反馈。论文的破局思路叫”事后重贴标签”(hindsight relabeling):加一个自省官(视觉语言大模型),当机器人搞砸后,自省官会说”它刚才的目标虽然不是关微波炉门,但它其实完美地拿起了桌上那个杯子,我们把任务指令改成拿起杯子”,一次原本被判死刑的失败数据瞬间变成成功经验。实验结果:机器人掌握新技能的速度快了近两倍。人类的对应案例是钉钉战略级AI项目 ONE 的产品经理幽素——她用 7.5 万字《置身钉内》复盘了项目从生到死的完整链路,把一个”失败产品”重新贴上了”完整AI产品生命周期复盘”的标签,刷屏后成为 AI 产品人的认知财富。
-
抽象是熬出来的,而且会在中途达到巅峰:AI 的抽象能力(如从国王 - 男人 + 女人 = 女王中学到”性别”概念)不是一直线性上升,而是经历一个倒U型过渡曲线——在训练中途达到巅峰时概念直线最清晰、最纯粹,但继续训练后为照顾现实世界的边缘情况和特例,AI 不得不做出妥协,让抽象概念变得模糊、扭曲一些以换取整体任务合格。这对人的启发:(1) 真正的顿悟需要深度加工,信息必须在大脑里多走几步才能淬炼出本质洞见;(2) 最纯粹、最接近本质的顿悟时刻,往往在刚看破、尚未被世俗细节磨钝的那个阶段。
-
当AI卡死,给它换句话就破局了:机器人执行”关微波炉门”时总跑去抓旁边的杯子——因为在它记忆里”微波炉”总跟”杯子”关联。研究人员没改大脑,而是把指令换成”推一下那个黑色的家电门,直到它合上”,机器人立刻跳出脑内陷阱、精准完成任务。更关键的是让大模型自己当教练——观察失败全过程后诊断”词汇干扰”,自己生成一堆新指令逐个去试。这套方法让机器人在很短时间学会过去怎么也学不会的复杂任务。对人类的启示:改变行为最高效的方式往往是改变认知的框架;当沟通卡死时,别在原地干耗,换个说法、换个比喻、换个视角,对方的认知框架一变,正确行为自己就流出来了。
实操内容保留
(本文为观点类文章,无实操代码/模板/步骤)
关键概念
- 费曼学习法:视频生成模型验证了费曼名言——能造出来才算真懂
- 事后重贴标签:通过重新定义指令将失败数据转为成功经验的 AI 训练方法
- 认知框架转换:改变行为最高效的方式是改变认知框架,而非纠正具体动作
- 提示词工程:提示词驱动探索——大模型当教练,根据机器人失败反馈生成新指令
- 项目复盘:幽素的《置身钉内》复盘——失败产品通过诚实复盘变成稀缺认知资产
- 视频生成模型:为生成动态世界被逼着建立三维空间和物理规律的理解
- Agent安全护栏:纠正机器人的”不改主脑只递念头”方法呼应 Agent 安全设计中的最小干预原则
与其他素材的关联
- 2026-06-18-dingtalk-one-product-thinking:《置身钉内》解读素材,本文通过”失败重贴标签”概念为其提供 AI 算法层面的框架印证
- 2026-05-23-woshipm-sop-as-cot-agent-clone-expert:SOP 即思维链——本文的意识小模型(在认知源头递提示)同构于 SOP 注入 Agent 的逻辑
- 2026-07-01-woshipm-learn-ai-from-bilibili-up:五道口纳什用费曼学习法”通过讲而学”做 B 站内容——本文用视频生成模型为费曼法补充了 AI 实现层面的平行证据
原文精彩摘录
我们总以为感知和创造是两码事,先看懂了再谈创造。但AI告诉我们,当你能凭空造出一个符合物理规律的东西时,你其实已经掌握了对它最高级的理解。
你看,这跟论文里那个意识小模型是一个道理。真正高级的纠正,你不要去替他执行,更不要去动他的能力本身,你要去找到他做这件事最开始的那个念头,顺着他的内在逻辑,递给他一个正确的提示。他接住了这个提示,接下来就会用他自己最习惯、最顺手的方式,把事情漂漂亮亮地做完。
就这样,一次原本被判死刑、要被扔进垃圾桶的失败数据,一瞬间变成了一次有价值的成功经验。机器人虽然在原任务上失败了,但它顺便学会了怎么拿杯子、怎么推抽屉、怎么碰到积木。通过这种给每一个失败重新贴标签的方式,机器人能从自己干砸的每一个动作里,实实在在地学到真本事。
学习的高峰往往不在终点,而在中途。……在训练的中途,AI 的抽象能力会达到一个巅峰,那个时候它脑子里的概念直线最清晰、最纯粹。但随着训练继续推进,为了照顾现实世界里那些不完美的细节、那些边缘情况和特例,AI 不得不做出妥协,让那个原本完美的抽象概念变得模糊、扭曲一点点,以此换取整体任务的合格。
改变行为最高效的方式,往往是改变认知的框架。……别去死磕那个动作,退一步,帮他换一句能重新理解问题的话,换个比喻、换个视角、换种表达方式。他脑子里的认知框架一变,正确的行为自己就流露出来了。
你以为你在往外看一个机器,看着看着,看到的其实是自己。我们理解世界、纠正偏差、消化失败、沉淀认知的那套规律,和AI在数据里被逼出来的那套规律,本来就是同一件事的两个说法。