保姆级教程:用Image2 + Seedance2.0 做长视频,以品牌广告为例
来源:掘金 | 字数:约 4500 字 | 领域:AI 视频制作
核心观点
-
AI 长视频的核心瓶颈是 15 秒上限 + 一致性问题:所有主流 AI 视频工具(Seedance、Kling、Hailuo)单次最多生成 15 秒,拼接时人脸漂移、动作跳帧、前后场景对不上;更深层问题是每段单独出图导致人物长相、光线、风格全不统一——来源:实战案例(Laura Geller 口红广告 115 秒成片)
-
资产前置是一致性问题的根本解法:人物设定(三视图+多表情+服装细节图)、场景设定(空景+全/中/近三景别+360°环视视频)、产品设定(正面/侧面/45度/使用状态/logo特写)、音色设定(旁白与对白分开+30秒样本存档)四类资产必须在生成视频前全部备好,模型在不同段之间容易漂移,有参考图才能锁住
-
分镜生视频有三种方式,按镜头类型选:方式一纯提示词(适合独立开场镜头)、方式二分镜模式/Storyboard(适合多镜头快切、产品展示)、方式三尾帧衔接(适合剧情连续镜头);尾帧衔接的关键坑:不能直接截尾帧做下一段首帧,需要先导入剪辑软件导出一次统一编码,再截尾帧,并删掉下一段开头 1-2 帧防卡顿
-
提示词结构必须包含禁止项:主体+行为+景别+运镜+风格约束+禁止项,禁止项如「禁止迁移参考图的画面风格」防止模型乱引用参考图整体风格
-
旁白必须整段一次生成,不能按镜头拆分:拆段生成会导致语速、情绪、语气前后不一致;正确操作是完整文案一次性生成,再到剪辑软件按画面时长逐句对准时间点——剪音频对画面,不是剪画面对音频
-
音频三类(旁白/环境音/背景音乐)分开处理,混音层级明确:旁白 > 对白 > 环境音 > 背景音乐;环境音优先在生成视频时同步生成(模型对当前画面声音判断更准);背景音乐压到最低只做氛围托底
实操内容保留
镜头六要素清单
每个镜头必须标清:
- 景别(全/中/近/特写)
- 主体行为
- 运镜方式(固定/推进/拉远/跟拍)
- 情绪氛围
- 预计时长
- 有没有人物说话(决定音频处理方式)
镜头时长标准
- 特写或静态镜头:5 秒
- 有人物动作的中景:5-10 秒
- 需要完整交代信息:10-15 秒
- 原则:能拆就拆,时长越短利用率越高,切镜头比强行拉长更自然
转场选择逻辑
| 场景 | 转场方式 |
|---|---|
| 同场景、景别接近 | 硬切 |
| 跨场景 | 叠化(0.5 秒以内) |
| 情绪转折 | 闪白/闪黑 |
| 两段明显拼不上 | 补生成 2-3 秒过渡镜头 |
剪辑顺序
按分镜顺序拼素材 → 逐个检查衔接点处理卡顿、穿帮、色差 → 加字幕 → 最后配音频(不要提前配音,剪辑过程中时长会变)
资产设定清单
人物设定:
- 全身三视图(正面/侧面/背面)
- 正面半身版(给近景镜头用)
- 表情至少 3 种(自然闭嘴/微笑/专注皱眉)
- 服装和配饰单独出细节图
场景设定:
- 无人空景,固定光线和色调
- 每个场景三张:全景/中景/近景
- 进阶:360°场景环视视频,生成人物镜头时附上并在提示词里写明站位
产品设定:
- 正面图(包装完整无遮挡)
- 侧面图(看清色柱或材质)
- 45度斜侧图(最常用)
- 产品被拿起或使用中的状态图
- logo和品牌字体特写
音色设定:
- 旁白音色和人物对白音色分开定
- 30秒样本试听确认
- 存档音色ID,全片统一
关键概念
- Seedance 2.0:视频生成模型,本文用其图生视频功能,单次最长 15 秒
- GPT Image 2:图像生成工具,用于生成人物/场景/产品参考图
- ElevenLabs:语音合成工具,用于音色设计
- MiniMax:语音合成工具,可用于音色设计
- 豆包:图像生成工具,性价比高,适合低成本大量试错
- 分镜模式(Storyboard):一个提示词描述多个画面,一次生成六宫格或九宫格关键帧
- 尾帧衔接:生成上一段 → 导出统一编码 → 截尾帧 → 用尾帧+新提示词生成下一段
与其他素材的关联
- 与 2026-04-29-deepseek-ai-video-tutorial 同属 AI 视频制作领域,但本文聚焦长视频拼接方法论,前者聚焦基础教程
- 与 2026-06-13-ai-children-clothing-video-skill 同属 AI 视频应用,前者聚焦童装行业,本文聚焦品牌广告
- 与 Seedance 2.0 实体页中的全剧本理解能力互补——Seedance 在短剧场景有全剧本理解能力,在广告场景则需要手动管理一致性
原文精彩摘录
“很多人开始用 AI 做长视频,基本都卡在同一个地方:单次最多生成 15 秒。想做完整广告只能拼,一拼就出问题:人脸漂移,动作跳帧,前后场景对不上。换工具没用,从 Seedance 换到 Kling 换到 Hailuo,结果一样,15 秒已经是AI生成视频的上限,只能少不能多。“——这段话精准概括了当前 AI 视频生成的核心技术瓶颈,说明问题不在工具选择而在方法论。
“不能直接截尾帧就拿去做下一段的首帧,衔接处会有明显色差和跳变。所以需要把上一段导入剪映、PR等导出一次,用导出后的尾帧做下一段首帧,再拼接时删掉下一段开头 1-2 帧防止卡顿。“——这是尾帧衔接的核心踩坑经验,看似简单但大多数人都会犯的错误。
“旁白必须整段一次生成,不能按镜头拆成一句一句。拆段生成会导致语速、情绪、语气前后不一致,拼起来接缝明显。正确操作是选好音色后,完整文案一次性生成,再到剪辑软件里按画面时长逐句对准时间点。注意是剪音频对画面,不是剪画面对音频,画面时长不能动。“——这条音频处理原则对所有 AI 长视频制作都适用。