靠AI视频赚百万的人:我一点AI不学

顶级 AI 视频创作者 DiDi_OK 用 Seedance 2.5 零后期做出 B 站热搜第一、300 万播放的短片《糖果》。他不学 AI 培训、从不看任何 AI 作品、手打上千字提示词,靠的是一句”我一点AI不学”背后的美术底子、克制美学和”小数点前面”的取舍哲学。这篇对谈揭示顶尖创作者如何把模型能力、构图明度和叙事克制组合成别人无法复制的竞争力。

基本信息

  • 来源类型:文章(人人都是产品经理 / 作者 知危)
  • 原文位置raw/articles/2026-09-18-121653-tg-7886d4.md
  • 原文 URLhttps://www.woshipm.com/ai/6466043.html
  • 作者:知危(人人都是产品经理)
  • 发布日期:2026-09-18
  • 消化日期:2026-09-18
  • 主题:AI 视频创作、Seedance 2.5、创作者竞争力、美学基础与克制

核心观点

  1. 《糖果》用 Seedance 2.5 零后期制作,全片由 Seedance 2.5 生成、BGM 由 Suno 生成:短片冲上 B 站热搜第一、登顶全站排行榜、拿下 300 万播放。作者 DiDi_OK 此前用《牌子》拿下 1000 多万播放、郭帆导演转发点赞、B 站 AI 视频大赛冠军。海外同行评价极高——AI 创意总监 Uncanny Harry 说”格局很大,但你得留意那些小细节做得有多好:皮肤的纹理、指甲、蚂蚁”;艾美奖得主 Sam Wasserman 评价”概念聪明,执行扎实”;前 Netflix 制作高管、做过《曼达洛人》和《光环》的创意总监也排队夸。

  2. Seedance 2.5 的”镜头晃动”和”镜头变焦”让 DiDi_OK 评价两极反转:8 月初他拿到火山引擎 Seedance 2.5 内测账号,本不期待(“2.5嘛,能有多大变化,不然就叫3.0了”)。但测试”镜头晃动”和”镜头变焦”两个效果后改观。晃动过去要靠 Blender 手动加,变焦更是过去所有模型的短板(“要么做得不够真实、要么只能整台机器往前飞”),而在 Seedance 2.5 里几乎每一段提示词都会写上变焦,甚至”用得非常嚣张”。他用”小数点前后”判断:变焦和晃动试完后,2.5 小数点前面的那个”1”已经有了。于是《糖果》成了他第一条只用一个视频模型的片子;上一部《垃圾站》花十万请配音团队,这次配音和音效全部由 2.5 直出,一分钱没花。

  3. “抽卡”仍在做,但现在最重要、最费力气的是提示词:警察局那个镜头”大概抽了小 1000 次”,做了近一周;多重空间的镜头次数更多。但和半年前不一样的是,抽卡已经不再是花力气最多的地方。DiDi_OK 说只要描述足够详细、能把脑海里的画面呈现出来,2.5 基本都能理解。蚂蚁搬糖那段他先按老办法把每张背景画成图再拿去生视频,结果发现都不如直接拿文字描述去生,提示词一遍就过。

  4. 提示词 1000~2000 字、70% 手打、不让 AI 润色,原因是”只有自己写的迭代时才知道哪出问题”和”AI 润色会丢失细节”:DiDi_OK 的提示词里有很多口语化词,“特别强调 XXX”后面跟一连串感叹号。一旦经过 AI 修饰,这些单独要强调的东西容易变平和,模型锚定不住就 get 不到细节。他写提示词时会跟女朋友说:“现在不要打扰我,我要把灯光开暗一点,我要进入到一个地狱状态了。“(一条 10 分钟左右的视频,光提示词加起来就够一本几万字小说。)

  5. “我一点AI不学”——最该学的反而是基础美术:DiDi_OK 公司有严格 AI 培训(讲 JSON 提示词和画质增强工具),他从不参加,理由是”如果 AI 还需要去学,那它就已经失去 AI 的意义了”。他举梵高《向日葵》——凑近看只是一团颜色,离远了才知道是向日葵;早期作品《箭头》就遵循这个原理,单个镜头不必很具体清晰,连着看能看懂故事就够了。再往下是印象派的逻辑:框架绝对准确、构图里黑白灰的明度绝对准确,然后再调颜色(莫奈的睡莲颜色乱七八糟,但因为明度准确所以像睡莲)。他甚至认为美学是科学——人看到红色觉得热,是进化里红色代表见到火,是祖先留下的一串 DNA。

  6. “小数点前面的东西”哲学:多去看被时间验证过的老东西,不要看 AI 作品:DiDi_OK 从不看任何 AI 作品,连社交媒体都是被逼着用、用起来有痛苦感。他手机里全是吃播和存下来的画,最近和经纪人看完两本古龙、每天聊古龙。他做游戏概念设计出身——概念设计师从不看别人的概念设计,而是不断地看油画(莫奈、伦勃朗),就像周杰伦不听流行音乐、听交响乐。“如果你想持续做出自己的东西,你就多去看小数点前面的东西,不要去看后面的。因为你看小数点后面的东西,你也只能在它的后面,0 的后面再加一个 0。“他最近在重看《加勒比海盗 3》的开场长镜头,边看边想用 AI 复刻这么复杂的长镜头调度得用多少技术。

  7. “克制”是作品和复刻者拉开差距的信念:DiDi_OK 见过很多复刻他的人,尤其 2.5 刚发布那阵所有片子都被复刻了一遍,但评价是不够克制——“现在 AI 做一个怪兽很容易,乍一看很帅,但这个帅是没有内容的。“《糖果》的克制是视觉锚点始终压在糖果上,他完全可以让整条街、整个城市的人都炸掉,观众会很爽,但那样观众就很难把情绪专注在爆炸和内容的探讨上,更多的是一种发泄。《指环王 2》圣盔谷大战打完,彼得·杰克逊没拍惨烈画面,而是拍了两个霍比特人坐在废墟上抽烟——“导演对自己的故事做减法”。《复仇者联盟》前三部经典、后面挨骂,也是因为”CG 从 2000 年初迭代那么多次,能做更帅的画面,反而失去了故事的克制”。

  8. “美学是科学”的模型判断标准:别人看的是能不能做出来,他看的是做得对不对:DiDi_OK 测模型能力用美术标准,给模型团队提反馈全说饱和度、明度这些词,甚至建议模型团队测试人员多学点美术。他说模型走偏都是在美术上出问题、不是技术上出问题。这次看到 2.5 对饱和度和明度的控制他就已经有答案了——“它绝对能做超级多的事情,只是大家没有去试而已。”

  9. 未来两类人会在 AI 视频里获得巨大优势:一类是专业的人(导演出身、美术出身);另一类是想象力丰富、自己就很有趣、有人情味的人(画面没那么精良但非常贴近大众)。至于”普通人一句话就能出大片”,DiDi_OK 认为不构成反驳——“大家的识字量其实差不多,莫言会的字我们都认识,但我们写不出莫言的书。一句话是能出内容,但只能出差不多的内容,出不了美术上精良的内容。“数字拍摄和棚拍都这么成熟了,诺兰拍《奥德赛》还是用胶片实拍,和纯棚拍+CG 的《复仇者联盟》质感明显不同,因为诺兰的美术极度登峰造极。但他坦言:“我刚才给你的两个方向,我也没有自信最后我会是那两拨人里的其中之一。“

实操内容保留

本文为人物专访/方法论文章,无常规代码块。以下保留文中给出的可直接复用的镜头运镜技巧、模型选型判断方法、提示词写作原则,这些是创作者操作层面可迁移的内容。

镜头运镜技巧(Seedance 2.5 可实现)

文中明确描述了数个此前只能靠后期、现在可由模型直出的运镜手法:

  • 手持”呼吸感”晃动:镜头带手持呼吸感,观众会觉得自己就是拿着手机在拍朋友,行话叫 UGC 感。过去要模型先生成稳定画面,再拿 Blender 手动加晃动;《糖果》里晃动全部由 Seedance 2.5 直出,“而且做得非常细腻”。
  • 变焦(同一画面推近拉远):DiDi_OK 认为变焦是视频跨入电影级别的一个重要标志。在 Seedance 2.5 里他几乎每一段提示词都会写上变焦,“甚至会用得非常嚣张”。例:两个航天员登陆潘那个镜头里,潘消失的瞬间镜头迅速”甩”近,记录人类悬空挂在热气球上。
  • 连续空间换场(不是转场):镜头匀速往后拉,中景每走过去一个人,场景就换成另一个地点、另一群人。前景和背景其实不在同一个空间,但观众看到的是一个连续镜头。他这次完全不想遮镜头——“我就想露给观众,它就是这么转过去的,所以它其实不是转场。“(曾在《Alt Tab》出现,当时是 AI 结合绿幕和 3D 用后期硬做的,他大方承认那不是 AI;这次能告诉大家是纯 AI 做的了。)

提示词写作原则(操作层面)

  • 写 1000~2000 字提示词,70% 手打,不用 AI 润色
  • 必须自己写才能迭代:只有自己写的,迭代时才知道哪出了问题——警察局那个镜头一直有 bug,他一眼就知道是哪句话的问题。AI 生成的提示词看着很完美很专业,但出问题时不知道是哪一句不对。
  • AI 润色会丢失细节:保留口语化强调词,如”特别强调 XXX”跟一连串感叹号,让模型锚定住要表达的细节。
  • 蚂蚁搬糖案例:背景一个个切换(美元、赌桌),糖果上的反光也跟着背景变。他一开始按老办法先把每张背景单独画成图再去生视频,结果发现都不如直接拿文字描述去生,提示词一遍就过。

模型能力判断方法(“小数点”框架)

  • 把一件事分为”小数点前面”和”后面”。1.23 中前面的 1 是决定这事成不成的关键,后面的 2 和 3 都是零头。
  • 判断一个模型能不能用,先看它能不能补上”小数点前面的 1”(如变焦、晃动这两个决定电影级品质的能力),再看零头。
  • 用美术标准(饱和度、明度)而非技术标准去给模型提反馈,因为”模型走偏都是在美术上出问题,而不是技术上出问题”。

关键概念

  • Seedance 2.0 — 字节跳动视频生成模型;本文的上游,作者此前用它制作《牌子》,2.5 是其升级版
  • 视频生成模型 — AI 视频生成的底层概念;本文的”镜头变焦/晃动/零后期”是其在产品层面的能力体现
  • 提示词工程 — 本文强调手打上千字提示词、不用 AI 润色,是对该领域”AI 写提示词”风潮的反向实践
  • Seedance 2.5 — 本文核心使用的视频生成模型(火山引擎/字节跳动);已存在 2026-08-11-Seedance2.5六种玩法 素材,未创建独立实体页,纯文本标注
  • DiDi_OK — 顶尖 AI 视频创作者(B 站 UP 主),本文主角;未创建实体页,纯文本标注
  • 克制 — 本文核心创作信念(视觉锚点不变、往后退做小东西);未创建实体页,纯文本标注
  • 美学是科学 — 进化心理学视角的美学观(红色→火→热);未创建实体页,纯文本标注
  • 小数点前后的取舍 — 作者的方法论核心;未创建实体页,纯文本标注
  • Suno — 本文 BGM 生成工具;未创建实体页,纯文本标注

与其他素材的关联

  • 2026-08-11-Seedance2.5六种玩法 的关系:同一模型(Seedance 2.5)的两条互补视角。那篇从”功能玩法”切入(时间暂停、50 参考素材、智能引用、混剪),提供可直接照抄的 Prompt 和操作教程;本篇从”创作者用户故事”切入,揭示顶尖创作者如何用美术底子、克制美学和”小数点”取舍来驾驭这个模型——功能清单回答”它能做什么”,本篇回答”什么样的人能把它做出片子的天花板”。
  • Seedance 2.0 实体页的关系:本篇提供了一个关键迭代事实——2.5 相比 2.0 的突破点在”镜头变焦、镜头晃动、音效直出、多角色调度”,而这些正是 2.0 时代(《牌子》多人脸、Google 地图动画手搓 3D)做不了的。可作为实体页”核心特性”部分的重要补充。
  • 视频生成模型 实体页的关系:本篇从创作者实测角度印证了那篇”视频生成模型被迫内化物理规律”的论点——Seedance 2.5 能做”合理的轴承运动机器狗""多角色多动物调度”,正是模型对物理和空间理解能力的体现。
  • AI内容创作 主题页的关系:本篇属于”AI 长视频制作方法论”和”创作者核心竞争力”子方向。它补上了该主题此前偏重”工具产能/自动化/爆款公式”的盲区——顶尖创作者的核心竞争力不是 AI 产能,而是美术底子、克制和取舍哲学。这与 AI产能与创意(AI 放大创意也放大套路)的观点形成有力的创作者侧呼应。
  • 2026-08-21-211357-tg-67489f(updream 预演台 + Seedance 2.5 白模参考)的关系:那篇强调用预演台排运镜降抽卡,本篇强调提示词质量本身才是抽卡以外最花力气的地方,两者在”减少无效抽卡”这一目标上是同一方向的实操补充。

原文精彩摘录

全片由 Seedance 2.5 生成,BGM 由 Suno 生成,零后期。…所以过去 DiDi_OK 都先让模型生成一段稳定的画面,再拿 Blender 手动给镜头加晃动。但到了《糖果》,晃动全部由视频模型 Seedance 2.5 直出,“而且做得非常细腻”。…变焦,更是过去所有模型的短板。…它就是在同一个画面里推近拉远,实拍摄影师随手就来,但视频模型要么做得不够真实、要么只能整台机器往前飞。但在体验 Seedance 2.5 后,DiDi_OK 在《糖果》里几乎每一段提示词里都会写上变焦,“我甚至会用得非常嚣张”。

“AI 时代,大家最该学的反而是基础美术。“…再往下是印象派的逻辑:框架绝对准确,构图里黑白灰的明度(也就是明暗关系)绝对准确,然后再去调颜色。莫奈的睡莲颜色乱七八糟,但你就觉得是睡莲,因为明度准确。他甚至认为美学是科学。人看到红色觉得热,是因为进化里看到红色就代表见到火,这是祖先留给我们的一串 DNA。创作者要做的,就是让 AI 最大化地满足能让大众感受到的情绪。

“如果你想持续做出自己的东西,你就多去看小数点前面的东西,不要去看后面的。因为你看小数点后面的东西,你也只能在它的后面,0 的后面再加一个 0。""这世界上,书籍、电影、音乐,有太多已经经受过时间考验的东西,这些都还没看完,为什么要去看那些还没被验证的东西。”

他给了一个词:克制。…他见过蛮多复刻他的人,尤其 2.5 刚发布那阵,他所有片子都被复刻了一遍。但他的评价是不够克制:“现在 AI 做一个怪兽很容易,乍一看很帅,但这个帅是没有内容的。“…史诗级的两军对冲,现在谁都能做,关键是能不能往后退,做小的东西。《指环王 2》圣盔谷大战打完,彼得·杰克逊没拍惨烈的画面,拍了两个霍比特人坐在废墟上抽烟。他说这就是导演对自己的故事做减法。

相关页面