保姆级教程:用Image2 + Seedance2.0 做长视频,以品牌广告为例

来源:掘金 | 字数:约 4500 字 | 领域:AI 视频制作

核心观点

  1. AI 长视频的核心瓶颈是 15 秒上限 + 一致性问题:所有主流 AI 视频工具(Seedance、Kling、Hailuo)单次最多生成 15 秒,拼接时人脸漂移、动作跳帧、前后场景对不上;更深层问题是每段单独出图导致人物长相、光线、风格全不统一——来源:实战案例(Laura Geller 口红广告 115 秒成片)

  2. 资产前置是一致性问题的根本解法:人物设定(三视图+多表情+服装细节图)、场景设定(空景+全/中/近三景别+360°环视视频)、产品设定(正面/侧面/45度/使用状态/logo特写)、音色设定(旁白与对白分开+30秒样本存档)四类资产必须在生成视频前全部备好,模型在不同段之间容易漂移,有参考图才能锁住

  3. 分镜生视频有三种方式,按镜头类型选:方式一纯提示词(适合独立开场镜头)、方式二分镜模式/Storyboard(适合多镜头快切、产品展示)、方式三尾帧衔接(适合剧情连续镜头);尾帧衔接的关键坑:不能直接截尾帧做下一段首帧,需要先导入剪辑软件导出一次统一编码,再截尾帧,并删掉下一段开头 1-2 帧防卡顿

  4. 提示词结构必须包含禁止项:主体+行为+景别+运镜+风格约束+禁止项,禁止项如「禁止迁移参考图的画面风格」防止模型乱引用参考图整体风格

  5. 旁白必须整段一次生成,不能按镜头拆分:拆段生成会导致语速、情绪、语气前后不一致;正确操作是完整文案一次性生成,再到剪辑软件按画面时长逐句对准时间点——剪音频对画面,不是剪画面对音频

  6. 音频三类(旁白/环境音/背景音乐)分开处理,混音层级明确:旁白 > 对白 > 环境音 > 背景音乐;环境音优先在生成视频时同步生成(模型对当前画面声音判断更准);背景音乐压到最低只做氛围托底

实操内容保留

镜头六要素清单

每个镜头必须标清:

  1. 景别(全/中/近/特写)
  2. 主体行为
  3. 运镜方式(固定/推进/拉远/跟拍)
  4. 情绪氛围
  5. 预计时长
  6. 有没有人物说话(决定音频处理方式)

镜头时长标准

  • 特写或静态镜头:5 秒
  • 有人物动作的中景:5-10 秒
  • 需要完整交代信息:10-15 秒
  • 原则:能拆就拆,时长越短利用率越高,切镜头比强行拉长更自然

转场选择逻辑

场景转场方式
同场景、景别接近硬切
跨场景叠化(0.5 秒以内)
情绪转折闪白/闪黑
两段明显拼不上补生成 2-3 秒过渡镜头

剪辑顺序

按分镜顺序拼素材 → 逐个检查衔接点处理卡顿、穿帮、色差 → 加字幕 → 最后配音频(不要提前配音,剪辑过程中时长会变)

资产设定清单

人物设定

  • 全身三视图(正面/侧面/背面)
  • 正面半身版(给近景镜头用)
  • 表情至少 3 种(自然闭嘴/微笑/专注皱眉)
  • 服装和配饰单独出细节图

场景设定

  • 无人空景,固定光线和色调
  • 每个场景三张:全景/中景/近景
  • 进阶:360°场景环视视频,生成人物镜头时附上并在提示词里写明站位

产品设定

  • 正面图(包装完整无遮挡)
  • 侧面图(看清色柱或材质)
  • 45度斜侧图(最常用)
  • 产品被拿起或使用中的状态图
  • logo和品牌字体特写

音色设定

  • 旁白音色和人物对白音色分开定
  • 30秒样本试听确认
  • 存档音色ID,全片统一

关键概念

  • Seedance 2.0:视频生成模型,本文用其图生视频功能,单次最长 15 秒
  • GPT Image 2:图像生成工具,用于生成人物/场景/产品参考图
  • ElevenLabs:语音合成工具,用于音色设计
  • MiniMax:语音合成工具,可用于音色设计
  • 豆包:图像生成工具,性价比高,适合低成本大量试错
  • 分镜模式(Storyboard):一个提示词描述多个画面,一次生成六宫格或九宫格关键帧
  • 尾帧衔接:生成上一段 → 导出统一编码 → 截尾帧 → 用尾帧+新提示词生成下一段

与其他素材的关联

原文精彩摘录

“很多人开始用 AI 做长视频,基本都卡在同一个地方:单次最多生成 15 秒。想做完整广告只能拼,一拼就出问题:人脸漂移,动作跳帧,前后场景对不上。换工具没用,从 Seedance 换到 Kling 换到 Hailuo,结果一样,15 秒已经是AI生成视频的上限,只能少不能多。“——这段话精准概括了当前 AI 视频生成的核心技术瓶颈,说明问题不在工具选择而在方法论。

“不能直接截尾帧就拿去做下一段的首帧,衔接处会有明显色差和跳变。所以需要把上一段导入剪映、PR等导出一次,用导出后的尾帧做下一段首帧,再拼接时删掉下一段开头 1-2 帧防止卡顿。“——这是尾帧衔接的核心踩坑经验,看似简单但大多数人都会犯的错误。

“旁白必须整段一次生成,不能按镜头拆成一句一句。拆段生成会导致语速、情绪、语气前后不一致,拼起来接缝明显。正确操作是选好音色后,完整文案一次性生成,再到剪辑软件里按画面时长逐句对准时间点。注意是剪音频对画面,不是剪画面对音频,画面时长不能动。“——这条音频处理原则对所有 AI 长视频制作都适用。