Coding 模型做视频
不做生视频模型抽卡,而是让 Coding 模型用 JavaScript / Three.js 把每一帧的画面写成代码、产出单文件 HTML,再用无头浏览器逐帧抓帧、FFmpeg 编码成 MP4——全程在 Agent 内完成,不打开一次剪辑软件,每一秒画面都完全确定、可重复计算、可修改。
简介
Coding 模型做视频是一条与”视频生成模型”平行的 AI 视频生产路线。它的输入是一段文字需求(常常是元提示词),输出是一份可运行的单文件 HTML 动画,再由工具链把它转成视频文件。
核心管线(三步):
- 写画面:LLM 用 JavaScript 或 Three.js 编写”每一帧应该长什么样”的绘制代码,生成单文件 HTML(实时渲染,供录制)。
- 抓帧:用无头浏览器逐帧捕获画面(
window.__seek(t)精确跳转抓帧)。 - 编码:用 FFmpeg 把帧序列编码成 MP4。
整套过程在 Agent(如 MiniMax Code、Claude Code)里完成。它与 Vibe Motion(代码驱动视频)属于同一家族,但技术底座不同:Remotion 走 React 组件帧驱动、HyperFrames 走原生 HTML 帧驱动,而本文这条路线走 Three.js + WebGL2 程序化生成 + 无头浏览器抓帧。
与视频生成模型的本质差异:视频模型是”抽卡”——同样提示词每次结果不同,画面靠概率生成;Coding 模型做视频是”计算”——每一秒画面由代码确定,用固定 seed(mulberry32)保证每次渲染完全一致,改一个参数即可精确重渲。作者的原话是:“在代码里,每一秒的画面应该长什么样,是完全确定、可重复计算的。也因此,后期想要修改,会非常方便。“
关键信息
- 类型:方法论(代码驱动视频的 AI 生产路线)
- 领域:AI 视频创作、程序化视觉生成、Agent 长程任务
- 核心管线:LLM 写代码 → 单文件 HTML → 无头浏览器逐帧抓帧 → FFmpeg 编码 MP4
- 常用技术栈:Three.js(WebGL2)+ 原生 HTML/CSS/JS,CDN 引入(esm.sh / unpkg),无构建步骤
- 关键能力:程序化生成(噪声 / 分形 / 贝塞尔 / 递归)、固定 seed 可复现、时间轴驱动、外部精确抓帧接口
window.__seek(t) - 典型 Agent:MiniMax Code、Claude Code
- 配套方法:Meta-prompting(元提示词)、元指令封装
- 相关概念:Vibe Motion、Remotion、HyperFrames、AI视频分镜、GPT-5.6(纯文本:Three.js、FFmpeg、无头浏览器)
核心特性
1. 确定性生产:可重复计算、可精确修改
这是它相对视频生成模型最根本的优势。视频模型的产出是概率性的,同一条提示词跑两次画面不同,修改只能靠改提示词再抽一次;代码路线的产出是确定性的——所有随机数用固定 seed 的自写 mulberry32 生成,同一份代码每次渲染结果完全一致。这意味着”后期修改”从”重新抽卡”变成”改一行参数精确重渲”。
2. 成本结构与画幅无关
原文明确对比:“不像视频模型,480P 一个价,1080P 又是另一个价,4K 基本上要家里有矿才跑得起。“代码路线里画幅、画质是可任意选的自由参数——渲染分辨率只影响本地算力与时间,不改变 API 计费。作者的四川文旅短片”大概烧了 1700 万 Tokens”,但因为官方每天重置额度,实际现金成本为 0。
3. 程序化美术规格(可复用为”铁律”)
这条路线要好看,靠的不是提示词运气,而是一套可执行的美术纪律。原文给出的文旅水墨片规格被写成”铁律”原样保留在输出模板里,典型条目包括:
- 色彩纪律:全片色域锁死在
#201E14(墨黑)~#D6D0B5(宣纸白)之间;每镜只允许一种高饱和强调色,从朱砂#8B3A2A/ 橙金#E8913A/ 青花蓝#2E4A7D/ 松绿#7A8B6F四色轮换,相邻镜头不重复。 - 调性交替:相邻镜头必须 亮↔暗 / 暖↔冷 / 动↔静 交替;全片唯一的”工艺黑场镜”必须紧跟最亮场景以制造明暗反转。
- 禁止项:禁止引用任何外部图片 / 模型 / 贴图;禁止 3D 建模感、写实光影、渐变彩虹、科技感粒子爆炸——所有元素必须程序化生成。
- 文字层与画面分离:DOM 文字层覆盖在 canvas 之上,不在 WebGL 里排文字;字幕颜色按背景明暗自动反相。
4. 镜头配方库:把”画面”拆成可参数化的程序
原文的元提示词里带一个「镜头配方库」,每个镜头从库里选配方或按同原则自拟,配方本身是程序化实现的说明,例如:
| 配方 | 程序化实现要点 |
|---|---|
| 山峦 | 1D 分形噪声(value noise + 4 层 fBm,固定 seed)生成山脉折线,5–6 层沿 z 拉开做空气透视,各层视差 0.4~1.2 倍 |
| 树 | L-system drawBranch(x,y,angle,len,depth) 递归,depth 5–6,松/竹/榕/胡杨由参数化 |
| 工艺(明暗反转) | 背景 #0A0A0A + 极暗砖墙,火焰/蒸汽用 8–12 层噪声扰动顶点的 Shape + AdditiveBlending |
| 器物转化 | LatheGeometry 车削 ~40 控制点,只做材质 crossfade 不做几何形变 |
| 地理脉络图 | LineDashedMaterial + computeLineDistances(),lineDashoffset 从全长降到 0「一笔画出」 |
5. 元提示词是核心资产
这条路线真正的杠杆不在”模型多强”,而在元提示词(见 Meta-prompting)。作者把”文旅水墨短片提示词架构师”打磨成模板:用户只给一个地名(可带时长),LLM 就自行决定母题、地标、诗词、分镜、文案、配色分配,产出一份”可原样投喂给代码 LLM”的完整提示词。进一步封装成「元指令 .md」后,只需给一个 TTS 模型 key(如 speech-2.8-hd),就能自动交付带配音的 MP4。
不同素材中的观点
关于确定性、成本与适用边界(主素材)
来源:2026-09-30-woshipm-coding-model-video-tutorial
沃垠AI 用 MiniMax Code + MiniMax-M3.1-Flash-Preview 做了一支四川文旅水墨短片(思考深度 Max,单任务约 2 小时),公开了整套元提示词与元指令。他给这条路线划出清晰边界:“在知识密度高、画面需要精确控制的场景,它相当靠谱,甚至比主流视频模型更可靠;在需要真实感、光影质感和复杂物理运动的场景,它目前还不靠谱。” 适用清单为:产品宣传片、产品演示、动态排版、歌词 MV、口播视频粗剪。同时给出模型对照:本任务上 M3.1-Flash-Preview 优于 GLM-5.3,但 3D 建模细节仍不及 Opus 5.5。
关于代码驱动视频的两条生产线(前序素材)
来源:2026-07-01-woshipm-vibe-motion-10-pitfalls
此前素材把 Vibe Motion 拆成两条生产线:全合成动画(所有画面由代码从零绘制,主力工具 Remotion / HyperFrames)与真人素材重剪(真人出镜 + 代码包装)。本文的 Three.js 水墨短片属于前者(全合成),但它换掉了 React 底座,直接用 Three.js + WebGL2 程序化生成,把”画面资产”从组件复用推进到”噪声/分形/贝塞尔参数化”。它也印证了那条核心判断:只有文字和想法、不需要真人出镜时,代码合成才是最优解。
关于与”混合资产产片工厂”路线的分工
来源:2026-07-26-youtube-claude-product-photo-ad-campaign
另一条主流路线是混合资产:Claude Code 读 playbook,Fal.ai + Seedance 2.0 出生视频、ElevenLabs 出旁白、HyperFrames 自动成片。它与本文路线的分工恰好互补——混合资产路线适合”需要真实感/产品实拍/多版本投放”的电商广告;本文路线适合”知识密度高、画面需精确控制、可完全代码合成”的宣传片与演示。两者共享同一套 Agent 编排与”把重复产片做成流水线”的工程思路。
实用信息
使用前提
- Agent:需要支持长程任务、自带工具调用与自我检查/修复的 Agent(原文用 MiniMax Code;用 Claude Code + 其他模型亦可复现——作者用 GLM-5.3 + Claude Code 做了山西版)。
- 模型:原生多模态、长上下文(原文 1M)、支持可调思考深度(low/medium/high/max)的 Coding 模型。
- 本地依赖:无头浏览器(用于逐帧抓帧)+ FFmpeg(用于编码)。可选 TTS 模型 key(用于配音)。
基本用法
- 把「文旅水墨短片提示词架构师」元提示词交给 LLM,附一个地名(可带时长)。
- LLM 产出四部分:素材速览(母题/地标/诗句/配色)、分镜总表、配音稿、最终提示词(```text 代码块)。
- 把最终提示词丢给 Coding Agent,它自己开跑:写代码 → 预览 → 渲染 → (接 TTS)配音 → 编码成 MP4。
- 用
?duration=/?t=或window.__seek(t)逐镜检查与抓帧。
注意事项
- 思考深度按任务选:简单快速任务 low、日常 medium、长程复杂任务 high 或 max(max 单任务可能耗时 2 小时)。
- 诗句必须真实:原文明确”拿不准真实性就放弃换句,绝不编造、绝不硬凑”——这是防止模型编造地标诗词的硬约束。
- 分镜时长不得有缝:总时长必须严格等于目标时长,逐帧累加不得有缝。
- 它是”另一条路径”而非”替代品”:不要用它硬扛真实感、光影质感、复杂物理运动的需求。
相关页面
- MiniMax Code — 主素材使用的 Agent
- MiniMax — M3.1-Flash-Preview 母公司
- Meta-prompting — 元提示词方法论
- Vibe Motion — 代码驱动视频所属的方法论
- Remotion — 同家族、React 底座的框架
- HyperFrames — 同家族、原生 HTML 底座的框架
- AI视频分镜 — 分镜表字段与叙事弧规格
- 视频生成模型 — 本文的对照面(抽卡式)
- 2026-09-30-woshipm-coding-model-video-tutorial — 完整元提示词与成本记录
- 2026-07-01-woshipm-vibe-motion-10-pitfalls
- 2026-07-26-youtube-claude-product-photo-ad-campaign