Coding 模型做视频

不做生视频模型抽卡,而是让 Coding 模型用 JavaScript / Three.js 把每一帧的画面写成代码、产出单文件 HTML,再用无头浏览器逐帧抓帧、FFmpeg 编码成 MP4——全程在 Agent 内完成,不打开一次剪辑软件,每一秒画面都完全确定、可重复计算、可修改。

简介

Coding 模型做视频是一条与”视频生成模型”平行的 AI 视频生产路线。它的输入是一段文字需求(常常是元提示词),输出是一份可运行的单文件 HTML 动画,再由工具链把它转成视频文件。

核心管线(三步):

  1. 写画面:LLM 用 JavaScript 或 Three.js 编写”每一帧应该长什么样”的绘制代码,生成单文件 HTML(实时渲染,供录制)。
  2. 抓帧:用无头浏览器逐帧捕获画面(window.__seek(t) 精确跳转抓帧)。
  3. 编码:用 FFmpeg 把帧序列编码成 MP4。

整套过程在 Agent(如 MiniMax Code、Claude Code)里完成。它与 Vibe Motion(代码驱动视频)属于同一家族,但技术底座不同:Remotion 走 React 组件帧驱动、HyperFrames 走原生 HTML 帧驱动,而本文这条路线走 Three.js + WebGL2 程序化生成 + 无头浏览器抓帧。

与视频生成模型的本质差异:视频模型是”抽卡”——同样提示词每次结果不同,画面靠概率生成;Coding 模型做视频是”计算”——每一秒画面由代码确定,用固定 seed(mulberry32)保证每次渲染完全一致,改一个参数即可精确重渲。作者的原话是:“在代码里,每一秒的画面应该长什么样,是完全确定、可重复计算的。也因此,后期想要修改,会非常方便。“

关键信息

  • 类型:方法论(代码驱动视频的 AI 生产路线)
  • 领域:AI 视频创作、程序化视觉生成、Agent 长程任务
  • 核心管线:LLM 写代码 → 单文件 HTML → 无头浏览器逐帧抓帧 → FFmpeg 编码 MP4
  • 常用技术栈:Three.js(WebGL2)+ 原生 HTML/CSS/JS,CDN 引入(esm.sh / unpkg),无构建步骤
  • 关键能力:程序化生成(噪声 / 分形 / 贝塞尔 / 递归)、固定 seed 可复现、时间轴驱动、外部精确抓帧接口 window.__seek(t)
  • 典型 Agent:MiniMax Code、Claude Code
  • 配套方法:Meta-prompting(元提示词)、元指令封装
  • 相关概念:Vibe Motion、Remotion、HyperFrames、AI视频分镜、GPT-5.6(纯文本:Three.js、FFmpeg、无头浏览器)

核心特性

1. 确定性生产:可重复计算、可精确修改

这是它相对视频生成模型最根本的优势。视频模型的产出是概率性的,同一条提示词跑两次画面不同,修改只能靠改提示词再抽一次;代码路线的产出是确定性的——所有随机数用固定 seed 的自写 mulberry32 生成,同一份代码每次渲染结果完全一致。这意味着”后期修改”从”重新抽卡”变成”改一行参数精确重渲”。

2. 成本结构与画幅无关

原文明确对比:“不像视频模型,480P 一个价,1080P 又是另一个价,4K 基本上要家里有矿才跑得起。“代码路线里画幅、画质是可任意选的自由参数——渲染分辨率只影响本地算力与时间,不改变 API 计费。作者的四川文旅短片”大概烧了 1700 万 Tokens”,但因为官方每天重置额度,实际现金成本为 0。

3. 程序化美术规格(可复用为”铁律”)

这条路线要好看,靠的不是提示词运气,而是一套可执行的美术纪律。原文给出的文旅水墨片规格被写成”铁律”原样保留在输出模板里,典型条目包括:

  • 色彩纪律:全片色域锁死在 #201E14(墨黑)~#D6D0B5(宣纸白)之间;每镜只允许一种高饱和强调色,从朱砂 #8B3A2A / 橙金 #E8913A / 青花蓝 #2E4A7D / 松绿 #7A8B6F 四色轮换,相邻镜头不重复。
  • 调性交替:相邻镜头必须 亮↔暗 / 暖↔冷 / 动↔静 交替;全片唯一的”工艺黑场镜”必须紧跟最亮场景以制造明暗反转。
  • 禁止项:禁止引用任何外部图片 / 模型 / 贴图;禁止 3D 建模感、写实光影、渐变彩虹、科技感粒子爆炸——所有元素必须程序化生成。
  • 文字层与画面分离:DOM 文字层覆盖在 canvas 之上,不在 WebGL 里排文字;字幕颜色按背景明暗自动反相。

4. 镜头配方库:把”画面”拆成可参数化的程序

原文的元提示词里带一个「镜头配方库」,每个镜头从库里选配方或按同原则自拟,配方本身是程序化实现的说明,例如:

配方程序化实现要点
山峦1D 分形噪声(value noise + 4 层 fBm,固定 seed)生成山脉折线,5–6 层沿 z 拉开做空气透视,各层视差 0.4~1.2 倍
树L-system drawBranch(x,y,angle,len,depth) 递归,depth 5–6,松/竹/榕/胡杨由参数化
工艺(明暗反转)背景 #0A0A0A + 极暗砖墙,火焰/蒸汽用 8–12 层噪声扰动顶点的 Shape + AdditiveBlending
器物转化LatheGeometry 车削 ~40 控制点,只做材质 crossfade 不做几何形变
地理脉络图LineDashedMaterial + computeLineDistances(),lineDashoffset 从全长降到 0「一笔画出」

5. 元提示词是核心资产

这条路线真正的杠杆不在”模型多强”,而在元提示词(见 Meta-prompting)。作者把”文旅水墨短片提示词架构师”打磨成模板:用户只给一个地名(可带时长),LLM 就自行决定母题、地标、诗词、分镜、文案、配色分配,产出一份”可原样投喂给代码 LLM”的完整提示词。进一步封装成「元指令 .md」后,只需给一个 TTS 模型 key(如 speech-2.8-hd),就能自动交付带配音的 MP4。

不同素材中的观点

关于确定性、成本与适用边界(主素材)

来源:2026-09-30-woshipm-coding-model-video-tutorial

沃垠AI 用 MiniMax Code + MiniMax-M3.1-Flash-Preview 做了一支四川文旅水墨短片(思考深度 Max,单任务约 2 小时),公开了整套元提示词与元指令。他给这条路线划出清晰边界:“在知识密度高、画面需要精确控制的场景,它相当靠谱,甚至比主流视频模型更可靠;在需要真实感、光影质感和复杂物理运动的场景,它目前还不靠谱。” 适用清单为:产品宣传片、产品演示、动态排版、歌词 MV、口播视频粗剪。同时给出模型对照:本任务上 M3.1-Flash-Preview 优于 GLM-5.3,但 3D 建模细节仍不及 Opus 5.5。

关于代码驱动视频的两条生产线(前序素材)

来源:2026-07-01-woshipm-vibe-motion-10-pitfalls

此前素材把 Vibe Motion 拆成两条生产线:全合成动画(所有画面由代码从零绘制,主力工具 Remotion / HyperFrames)与真人素材重剪(真人出镜 + 代码包装)。本文的 Three.js 水墨短片属于前者(全合成),但它换掉了 React 底座,直接用 Three.js + WebGL2 程序化生成,把”画面资产”从组件复用推进到”噪声/分形/贝塞尔参数化”。它也印证了那条核心判断:只有文字和想法、不需要真人出镜时,代码合成才是最优解。

关于与”混合资产产片工厂”路线的分工

来源:2026-07-26-youtube-claude-product-photo-ad-campaign

另一条主流路线是混合资产:Claude Code 读 playbook,Fal.ai + Seedance 2.0 出生视频、ElevenLabs 出旁白、HyperFrames 自动成片。它与本文路线的分工恰好互补——混合资产路线适合”需要真实感/产品实拍/多版本投放”的电商广告;本文路线适合”知识密度高、画面需精确控制、可完全代码合成”的宣传片与演示。两者共享同一套 Agent 编排与”把重复产片做成流水线”的工程思路。

实用信息

使用前提

  • Agent:需要支持长程任务、自带工具调用与自我检查/修复的 Agent(原文用 MiniMax Code;用 Claude Code + 其他模型亦可复现——作者用 GLM-5.3 + Claude Code 做了山西版)。
  • 模型:原生多模态、长上下文(原文 1M)、支持可调思考深度(low/medium/high/max)的 Coding 模型。
  • 本地依赖:无头浏览器(用于逐帧抓帧)+ FFmpeg(用于编码)。可选 TTS 模型 key(用于配音)。

基本用法

  1. 把「文旅水墨短片提示词架构师」元提示词交给 LLM,附一个地名(可带时长)。
  2. LLM 产出四部分:素材速览(母题/地标/诗句/配色)、分镜总表、配音稿、最终提示词(```text 代码块)。
  3. 把最终提示词丢给 Coding Agent,它自己开跑:写代码 → 预览 → 渲染 → (接 TTS)配音 → 编码成 MP4。
  4. 用 ?duration= / ?t= 或 window.__seek(t) 逐镜检查与抓帧。

注意事项

  • 思考深度按任务选:简单快速任务 low、日常 medium、长程复杂任务 high 或 max(max 单任务可能耗时 2 小时)。
  • 诗句必须真实:原文明确”拿不准真实性就放弃换句,绝不编造、绝不硬凑”——这是防止模型编造地标诗词的硬约束。
  • 分镜时长不得有缝:总时长必须严格等于目标时长,逐帧累加不得有缝。
  • 它是”另一条路径”而非”替代品”:不要用它硬扛真实感、光影质感、复杂物理运动的需求。

相关页面