AI视频剪辑自动化
用 AI 把”上传视频 → 自动分析 → 文案生成 → 配音 → 字幕同步 → 成片”整条链路自动化的应用形态。翔宇用 Claude Code 从零开发的视频剪辑 Web 应用是一个完整实战样本:单个短视频剪辑成本约 0.0X 美元,可批量复刻市面爆款风格。
简介
AI视频剪辑自动化指用大模型理解视频画面、生成匹配文案、合成配音与配乐、同步字幕,最终自动产出成片的工作流。翔宇基于自己的 N8N 工作流(视频38)需求,用 Claude Code 从零开发了一套 Web 应用来落地这条链路:用户只需上传视频,软件自动完成视频分析、文案生成、脚本、字幕同步、配音配乐合成。
它的核心价值是把”每条视频都要人写稿、配音、剪辑”的重复劳动压成”上传素材 + 一句话提示词”。翔宇实测覆盖了美食纪录片(《蛇尖上的中国》)、短剧混剪(毒蛇电影风格)、财经口播(SpaceX IPO)、抖音带货(猪油、橘子、烧烤啤酒、酱油)等十几种场景,说明这类应用在短视频带货领域用途很广,且能高相似度复刻爆款风格。
关键信息
- 链路:上传视频 → 视频分析(多模态理解画面)→ 文案生成 → TTS 配音 + 配乐 → 字幕同步 → 分镜配音合成 → 成片
- 技术栈(翔宇实现):Next.js + TypeScript + Tailwind CSS + Docker,5.5 万行代码、15 张表、34 个路由、8 个前端页面
- 模型:谷歌 Gemini(AI Studio / Vertex 二选一,普通用 AI Studio 一个 Key 即可),主力 2.5 Pro;多模态理解视频最强、价格低
- 配音:Fish Audio(数十万音色,需注册 API)或微软免费 TTS(云溪等音色,也够用)
- 成本:单条 10–20 秒短视频约 0.0X 美元;四个视频混剪示例约 0.2 美元,Fish Audio 约 0.08 美元;批处理可再省 50%
- 相关概念:AI视频分镜、爆款结构迁移、爆款广告复刻、n8n、Claude Code、半部署、视频生成模型
核心特性
1. 一句话提示词控制风格
剪辑提示词非必填——不填时软件自动决定走向,填了则可控制视频重点和风格。翔宇的关键玩法是爆款风格复刻:把想模仿的爆款短视频(如”毒蛇电影”解说)全选复制其提示词,再用一句极简提示词”完整观看这个爆款短视频,分析里面的爆款基因,将下面的提示词转化成 XX 的提示词”,配合上传爆款样例,就能输出一套完整的对标风格提示词,存为自定义风格反复用。
2. 文本语言是核心,画面是辅助
翔宇的核心判断:“字幕/文本语言传递的是最核心的思想,画面是它的辅助。” 只要把文本语言(文案 + 语调 + 说话方式)定下来,整个视频风格就能随意按需调整。这解释了为什么财经口播能做到”像知名主播”——靠的是文案和配音风格的迁移。
3. 原声片段智能保留
软件加入了对原声的支持:可设置在成片中保留几个原声片段(0 = 全 AI 配音)。它会根据最合适的情况把该保留的原声(如最激烈的打斗、争吵对话)恢复进来,并做画面与声音大小匹配,增加剪辑的变化程度。塔尔萨之王、短剧等示例都用到了原声混合。
4. 系统并发与成本控制
针对视频剪辑会把分镜拆解后分别配音合成,可设系统并发数(推荐保持 3,过多需更好 CPU)。低分辨率采样帧数、批量生成旁白数量(10 个一组 / 20 个一组优化字幕)都影响 token 花费。翔宇通过隐式缓存(默认省 75%)、显式缓存(省 90% 需手动创建)、批处理(省 50%,适合非实时的自动化工作室)、模型路由(Pro/Flash 综合,省 80%)把成本压到几毛甚至一毛以下一条。
5. 半部署分发保护知识产权
翔宇把这套应用做成半部署形态:不公开提供 SaaS,而是放到平台模板市场,用户购买授权码后自己部署、自己填 Google/Fish Audio Key。开发者零并发成本,用户用自己的 Key 承担 API 花费。批量运作时可部署到多台服务器实现”十个账号批量出片”。
不同素材中的观点
- 2026-07-21-youtube-xiangyu-claude-code-video-app:翔宇把这套 AI 视频剪辑应用作为 Claude Code 教学的实战案例,用大量真实成片演示能力边界。核心观点:①短视频带货领域用途极广,抖音大量猪油/橘子等店铺就在这样批量做,本工具可近乎百分百复刻其相似度;②成本极低(几毛一条),批量化后是真正的杠杆;③文本语言决定风格、画面是辅助;④关键玩法是爆款风格复刻——只要有原始视频就能提取提示词模仿几乎所有市面风格;⑤可二次开发加字幕、特效、画面框、AI 生图插帧等。他同时坦诚这套应用的开发花了四个月、16 次大版本重构、4300 美元 API + 订阅、9600 条对话,痛点正来自一开始没做产品设计、需求定得太大。
实用信息
最小可行版本(MVP)建议
翔宇强调从简单开始:先做 0.1 版——单视频、Fish Audio 一个配音、不做多视频/Vertex/微软/风格管理/Docker/用户认证。连通性测试跑通后再逐步深化。这对应”先做最小可行的”原则,避免像他一样一开始就想做成熟复杂系统导致反复重构。
二次开发方向
- 加字幕、特效、画面框、广告位
- 播放到一半插入 AI 生成的搞笑画像(剪辑末帧重新生图 → 生成几秒短视频 → 插入原视频)
- 自动化改造后每天针对各店铺批量出片
- 部署到国外(TikTok / YouTube),用微软免费英文 TTS
注意事项
- SDK 版本坑:翔宇初期误用谷歌旧版 AI SDK(11 月停维护、不支持隐式缓存),一个大视频来回调用一下花了 100 多美元。开发前必须调研 SDK 是否官方、维护频率、功能覆盖。
- 谷歌不稳定:Gemini 价格低、多模态强,但因需求量大、GPU 紧张而不稳定。
- 素材版权:翔宇提醒配音/素材可能涉及版权,带货需自有产品素材。