1分钟学会AI桌面换装视频制作:从提示词到出片全流程

程序员鱼皮复刻海外百万播放的「AI 桌面换装视频」:装上一个开源 Skill,AI 像产品经理一样追问主角、场景、三套造型、台词与尺度档位共六个问题,最后吐出一段可直接投喂即梦/Cursor 的提示词模板,把 30 秒一镜到底的桌面录屏风视频一次做出来。

基本信息

核心观点

  1. 爆款复刻的入口不是「学会运镜」,而是「先装上别人封装好的 Skill」。作者开场即给出开源指路:github.com/liyupi/ai-desktop-outfit-video 是一个「AI 桌面换装视频」生成技能。玩法极简——“你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己写又臭又长的提示词。” 门槛被压到只剩”一句需求 + 一次复制粘贴”。

  2. Skill 的价值在于把「写提示词」这件事从人的负担变成 AI 的访谈流程。作者演示时只说了一句”我想创作 30 秒的视频”,AI 便像产品经理一样主动追问,共 六个问题:① 主角是谁(默认中国古典鹅蛋脸美人,可描述或上传参考图);② 视频场景(默认深蓝灰色调房间);③ 三套换装造型是什么;④ 视频里的台词(不喜欢默认台词可让 AI 改编);⑤ 尺度档位(软 / 中 / 硬三档)。问完即输出完整提示词,开源项目里有完整版参考提示词。

  3. 「输入素材 DIY」是这套流程里最容易被忽略但决定成片差异的一步。作者的中文参考图是先用 ChatGPT 生成的——即演示了”先生成参考图再提供给 AI”的两段式做法;场景从默认房间改成”安静的小酒吧”;造型自选水手服、洛丽塔、白领制服。也就是说 Skill 提供的是默认值,成片差异由使用者在五个变量上自己填。

  4. 出片环节的关键不是模型选择,而是四个生成参数:① 比例选 16:9(因为模拟电脑桌面);② 时长选 30 秒(Seedance 2.5 支持 30 秒);③ 使用默认的全能参考模式,不要开任何运镜预设;④ 先用 720p 试,1080p 的积分消耗真的太贵了,等效果满意了再上高清。工具本身可在即梦、豆包、MiniMax 等之间任选,只要支持 Seedance 模型或同级视频模型。

  5. Skill 还能跳过手动复制这一步,直接调 API 生成:去火山引擎官网获取一个 API Key 提供给 AI,AI 会直接调用 Seedance 2.5 的 API 生成视频并下载到本地,“全程不用你自己打开任何 AI 视频生成工具”(换成其他视频模型的 API 也可以)。

  6. 真正的「核心原理」是逆向工程,而不是正向创作:作者”直接找到爆火的原版视频,丢给 AI,让它帮我逐帧分析视频的画面和声音,并生成简单直接的提示词”。这里还叠加了 /grill-me 技能——“AI 如果没充分理解需求,就会主动找我人工确认”,把需求歧义在拆片阶段就消掉。

  7. 逐帧分析的价值在于拆出「机关」,也就是让视频看起来像真的那些视觉障眼法。AI 拆出来的核心机关有三条:① 镜头全程一动不动;② 人物站起来的时候镜头不跟,只拍到腰部以下——“看起来就像真的是电脑桌面壁纸”;③ 每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。三条合起来解释了为什么”桌面换装”看起来像桌面录屏而不像普通换装视频。

  8. 从拆片到开源,全流程几乎都由 AI 执行,人只做决策与验收:作者的路径是 拆片 → 让 AI 生成简洁提示词模板 → 拿去即梦测试(“一把就出了满意的效果”)→ 让 AI 把整个工作流封装成可复用的 Skill(提问流程、提示词模板、API 调用脚本全部自动生成)→ 让 AI 把技能开源到 GitHub 并自动生成含图文甚至 GIF 动图演示的 README。作者的原话是”整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收”。

  9. 这套方法可以泛化到任何爆款视频类型,不限于换装:“下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。”

  10. 评论区补上了这套方法的天花板:读者「王佳怡」指出”核心机关的拆解其实还是依赖人对原版视频的审美判断,要是 AI 漏掉了’留一秒钟空沙发镜头’这种细节,生成的视频直接就会穿帮,这套方法也不是所有爆款都能直接套用的。“——即 Skill 解决的是执行一致性,不解决”看出哪个细节是关键”的判断力。

实操内容保留

本文属工具操作型文章,含完整的分步教程与可直接复用的参数配置,按原文原样保留。

代码/配置

技能仓库与 API 入口(原文给出的地址)

# 桌面换装视频生成技能(开源)
https://github.com/liyupi/ai-desktop-outfit-video
 
# 作者开源教程仓库(本文收录其中)
https://github.com/liyupi/ai-guide
 
# API Key 获取入口(用于直接调 API 生成视频)
火山引擎官网 → 获取 API Key → 提供给 AI

生成参数配置(原文「生成之前,有几个注意事项」原样保留)

比例:16:9            # 模拟电脑桌面
时长:30 秒           # Seedance 2.5 支持 30 秒
模式:默认「全能参考模式」  # 不要开任何运镜预设
清晰度:先 720p 试 → 满意后再上 1080p   # 1080p 积分消耗贵

可用的第三方 AI 视频工具(原文列举)

即梦 / 豆包 / MiniMax ...(只要支持 Seedance 模型或同级别视频模型即可)

Prompt 模板

原文没有贴出完整的提示词全文(“在这个技能的开源项目中有完整版的参考提示词”),但给出了提问流程模板——即 Skill 向用户追问的六个槽位,可直接照抄成自建 Skill 的访谈脚本:

1. 主角是谁?        # 默认:中国古典鹅蛋脸美人;可文字描述,也可上传参考图
2. 视频场景?        # 默认:深蓝灰色调的房间
3. 三套换装造型?    # 例:水手服 / 洛丽塔 / 白领制服
4. 视频里的台词?    # 不喜欢默认台词可让 AI 按需求改写
5. 尺度档位?        # 软 / 中 / 硬 三档
6. (由 AI 汇总)→ 输出完整提示词,投喂任意支持 Seedance 的视频工具

起手的一句话需求(原文演示用句):

我想创作 30 秒的视频

操作步骤

A. 手动复制提示词的出片流程(原文主线)

  1. 打开一个 AI 工具(文中用 Cursor),启用「AI 桌面换装视频」技能;
  2. 对 AI 说一句需求:“我想创作 30 秒的视频”;
  3. 依次回答 AI 的六个追问(主角 / 场景 / 三套造型 / 台词 / 尺度档位),中途可按需提供参考图;
  4. 把 AI 输出的完整提示词复制出来;
  5. 丢进任意支持 Seedance(或同级视频模型)的 AI 视频工具,按 16:9、30 秒、全能参考模式、无运镜预设、720p 试跑的参数生成;
  6. 效果满意后再用 1080p 重出高清版。

B. 直接调 API 生成的出片流程(原文第 4 节)

  1. 去火山引擎官网获取 API Key;
  2. 把 Key 提供给 AI;
  3. AI 调用 Seedance 2.5 API 生成视频并下载到本地;
  4. 全程无需打开任何 AI 视频生成工具。
    • 注:换用其他视频生成模型的 API 同样可行。

C. 作者复刻爆款的方法论步骤(原文第 5 节「核心原理」)

  1. 找到爆火的原版视频;
  2. 把视频丢给 AI,让它逐帧分析画面与声音并生成简单直接的提示词(配合 /grill-me 技能,需求不清时 AI 主动找人工确认);
  3. 从逐帧分析中读出「机关」(例:镜头不动、起身不跟镜只拍腰部以下、换装前留一秒空沙发镜头);
  4. 让 AI 把机关整理成一段简洁的提示词模板;
  5. 拿模板到即梦测试验证;
  6. 验证通过后,让 AI 把整个工作流封装成可复用的 Skill(提问流程 + 提示词模板 + API 调用脚本全部自动生成);
  7. 让 AI 把技能开源到 GitHub,并自动生成含图文与 GIF 动图演示的 README。

配置/参数速查(作者给出的三套造型与场景示例)

槽位默认值作者本次选择可 DIY 方式
主角中国古典鹅蛋脸美人用 ChatGPT 先生成参考图再提供给 AI文字描述 / 上传参考图
场景深蓝灰色调的房间安静的小酒吧直接描述
三套造型(技能默认)水手服 / 洛丽塔 / 白领制服直接描述
台词(技能默认)让 AI 改写为适配文案直接描述 / 让 AI 改
尺度档位软 / 中 / 硬三档可选选档

关键概念

  • Seedance 2.0 — 文中出片环节指定使用的视频模型家族(文中提及 Seedance 2.5 支持 30 秒时长,并提供 API);本素材补充了”Seedance 用作 30 秒桌面录屏风短片的执行层”这一新用法。
  • AI Skill — 「AI 桌面换装视频」就是典型的 Skill 形态:把提问流程、提示词模板、API 调用脚本封装成可复用单元;本素材给出了”六问访谈 → 输出提示词”的具体 Skill 结构样本。
  • grill-me — 作者在拆片阶段显式使用了 /grill-me 技能,AI 理解不到位时主动找人工确认;本素材是 grill-me 在视频逆向工程场景(而非编程场景)的一次实战用法。
  • 提示词工程 — 本文的提示词不是人写出来的,而是由 AI 通过结构化访谈生成;属于”把提示词生产本身流程化”的一种用法。
  • 提示词模板 — Skill 的产出物即一段可复用的提示词模板(开源项目内含完整版参考提示词)。
  • [待创建] AI 桌面换装视频 — 本文的题材主体:以”电脑桌面录屏”为视觉伪装、三套造型切换 + 对白 + 特效字幕、30 秒一镜到底的 AI 视频形态。核心机关是镜头不动、起身不跟镜(只拍到腰部以下)、换装前留一秒空沙发镜头。
  • [待创建] AI 视频逐帧逆向工程 — 本文第 5 节的方法论:把爆款原片丢给 AI 做逐帧画面与声音分析,先拆出”机关”,再整理成提示词模板,最后封装成 Skill。
  • [待创建] 即梦 / 火山引擎(视频生成 API) — 文中提到的出片工具与 API Key 来源;未建实体页,此处用纯文本标注。
  • Cursor — 文中演示 Skill 调用所使用的 AI 工具。
  • ChatGPT — 用于先生成主角参考图,再提供给 Skill。
  • AI内容创作 / AI视频分镜 — 本素材属于 AI 视频内容生产的一条具体产线;与分镜方法相比,本文的重心在”整条片子作为一个镜头”的伪装式复刻。

与其他素材的关联

  • 2026-07-07-woshipm-viral-ad-operations-four-levels爆款广告复刻爆款结构迁移 的关系:同属”复刻爆款”的方法族,但复刻对象与产物不同——四段位那篇复刻的是广告结构(人群/痛点/场景/证明/动作/收口),产物是一个可投放的结构变量表;本文复刻的是一条具体视频的视觉机关(镜头不动 / 起身不跟镜 / 换装前留空镜头),产物是一段提示词模板 + 一个 Skill。前者面向投放,后者面向单条内容的手感。
  • 2026-07-23-woshipm-grill-me-skillgrill-me 的关系:同一作者的连续两篇,构成”同一个 Skill 的两种用法”——grill-me 篇讲它如何拷问需求做出一个软件产品(ChatGPT 文未提及的技能管理桌面应用),本文讲它如何作为视频逆向工程流程中的”需求澄清卡点”。两篇合看可以证明 grill-me 是领域无关的澄清协议(“泛化到非编程决策”在本文得到了第二个实证)。
  • 2026-06-23-image2-seedance-long-video-brand-adSeedance 2.0 的关系:那篇讲 115 秒品牌长片的资产前置 + 尾帧衔接,解决的是”多镜头拼接一致性”;本文是单镜头 30 秒一镜到底的极简形态,反而不需要资产前置——用”镜头全程不动 + 只拍腰部以下”主动消除跨镜头一致性问题。两条路线互为边界案例。
  • 2026-07-26-youtube-claude-product-photo-ad-campaign 的关系:都属”把视频生产从手工升级为可编排流水线”,但 Andy Lo 那篇的 Seedance 在四步流水线的第三步(静帧 → 短片动画),本文的 Seedance 则承担从提示词到成片的全部执行。
  • 2026-08-11-codex-9-video-skills 的关系:都主张”视频创作 = 一组可复用 Skill”,差别在本文的 Skill 是单个、垂直、面向一个具体视频形态(桌面换装),而不是九个模块的组合管线。
  • 2026-05-25-openclaw-deepseek-content-automation-sop2026-06-22-personal-ip-4-things 的关系:那两篇关注内容生产的”量与运营”,本文关注单条内容的”工艺与复刻”;共同点是把重复判断沉淀成流程/模型而非靠灵感。
  • 2026-09-21-woshipm-ai-text-garbage-internet 形成对照:那篇批评 AI 内容产能被用于批量制造垃圾;本文是同一产能的正向用法——用 AI 拆片 + 封 Skill 提高单条内容的工艺水平。输入端是”真实爆款原片 + 人的审美判断”,正好符合该主题”加速手段的正当性取决于输入端”的判据。

原文精彩摘录

最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。

视频里一个虚拟美女坐在电脑桌面上,你让她换什么衣服她就换什么衣服,还能对话。

果然,瑟瑟是第一生产力啊!

这个技能的玩法很简单。你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己又臭又长的提示词。

生成之前,有几个注意事项:比例选 16:9,因为是模拟电脑桌面;时长选 30 秒(Seedance 2.5 支持 30 秒);使用默认的全能参考模式就好,不要开任何运镜预设;建议先用 720p 来试,1080p 的积分消耗真的太贵了!等效果满意了再上高清。

AI 帮我拆出来了整条视频最核心的「机关」。比如镜头全程一动不动,人物站起来的时候镜头不跟,只拍到腰部以下,看起来就像真的是电脑桌面壁纸。还有每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。

最后我直接让 AI 帮我把这个技能开源到 GitHub 上,并且自动生成了一个有图有文、甚至有 GIF 动图演示的项目 README 文件。真的爽!

这也是得益于现在的 AI 模型 Agent 能力和视觉理解能力越来越强了。整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收。

下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。

(评论区 · 王佳怡)作者说整个流程几乎全由 AI 完成确实不假,把拆片、写提示词、封装这类脏活累活甩给 AI 能省不少时间,但核心机关的拆解其实还是依赖人对原版视频的审美判断,要是 AI 漏掉了’留一秒钟空沙发镜头’这种细节,生成的视频直接就会穿帮,这套方法也不是所有爆款都能直接套用的。

相关页面