1分钟学会AI桌面换装视频制作:从提示词到出片全流程
程序员鱼皮复刻海外百万播放的「AI 桌面换装视频」:装上一个开源 Skill,AI 像产品经理一样追问主角、场景、三套造型、台词与尺度档位共六个问题,最后吐出一段可直接投喂即梦/Cursor 的提示词模板,把 30 秒一镜到底的桌面录屏风视频一次做出来。
基本信息
- 来源类型:文章(人人都是产品经理 · 作者:程序员鱼皮,公众号「程序员鱼皮」)
- 原文位置:raw/articles/2026-09-21-191032-tg-b05c68.md
- 原文 URL:https://www.woshipm.com/ai/6467553.html
- 素材来源:Telegram bot 抓取(telegram_msg_id 3987),正文由 scripts/http_capture.py HTTP 优先抓取
- 消化日期:2026-09-21
- 开源项目:技能仓库 https://github.com/liyupi/ai-desktop-outfit-video ;作者开源教程仓库 https://github.com/liyupi/ai-guide
- 文章标签:AI视频 / ChatGPT / Cursor / 内容创作 / 提示词
核心观点
-
爆款复刻的入口不是「学会运镜」,而是「先装上别人封装好的 Skill」。作者开场即给出开源指路:
github.com/liyupi/ai-desktop-outfit-video是一个「AI 桌面换装视频」生成技能。玩法极简——“你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己写又臭又长的提示词。” 门槛被压到只剩”一句需求 + 一次复制粘贴”。 -
Skill 的价值在于把「写提示词」这件事从人的负担变成 AI 的访谈流程。作者演示时只说了一句”我想创作 30 秒的视频”,AI 便像产品经理一样主动追问,共 六个问题:① 主角是谁(默认中国古典鹅蛋脸美人,可描述或上传参考图);② 视频场景(默认深蓝灰色调房间);③ 三套换装造型是什么;④ 视频里的台词(不喜欢默认台词可让 AI 改编);⑤ 尺度档位(软 / 中 / 硬三档)。问完即输出完整提示词,开源项目里有完整版参考提示词。
-
「输入素材 DIY」是这套流程里最容易被忽略但决定成片差异的一步。作者的中文参考图是先用 ChatGPT 生成的——即演示了”先生成参考图再提供给 AI”的两段式做法;场景从默认房间改成”安静的小酒吧”;造型自选水手服、洛丽塔、白领制服。也就是说 Skill 提供的是默认值,成片差异由使用者在五个变量上自己填。
-
出片环节的关键不是模型选择,而是四个生成参数:① 比例选 16:9(因为模拟电脑桌面);② 时长选 30 秒(Seedance 2.5 支持 30 秒);③ 使用默认的全能参考模式,不要开任何运镜预设;④ 先用 720p 试,1080p 的积分消耗真的太贵了,等效果满意了再上高清。工具本身可在即梦、豆包、MiniMax 等之间任选,只要支持 Seedance 模型或同级视频模型。
-
Skill 还能跳过手动复制这一步,直接调 API 生成:去火山引擎官网获取一个 API Key 提供给 AI,AI 会直接调用 Seedance 2.5 的 API 生成视频并下载到本地,“全程不用你自己打开任何 AI 视频生成工具”(换成其他视频模型的 API 也可以)。
-
真正的「核心原理」是逆向工程,而不是正向创作:作者”直接找到爆火的原版视频,丢给 AI,让它帮我逐帧分析视频的画面和声音,并生成简单直接的提示词”。这里还叠加了
/grill-me技能——“AI 如果没充分理解需求,就会主动找我人工确认”,把需求歧义在拆片阶段就消掉。 -
逐帧分析的价值在于拆出「机关」,也就是让视频看起来像真的那些视觉障眼法。AI 拆出来的核心机关有三条:① 镜头全程一动不动;② 人物站起来的时候镜头不跟,只拍到腰部以下——“看起来就像真的是电脑桌面壁纸”;③ 每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。三条合起来解释了为什么”桌面换装”看起来像桌面录屏而不像普通换装视频。
-
从拆片到开源,全流程几乎都由 AI 执行,人只做决策与验收:作者的路径是 拆片 → 让 AI 生成简洁提示词模板 → 拿去即梦测试(“一把就出了满意的效果”)→ 让 AI 把整个工作流封装成可复用的 Skill(提问流程、提示词模板、API 调用脚本全部自动生成)→ 让 AI 把技能开源到 GitHub 并自动生成含图文甚至 GIF 动图演示的 README。作者的原话是”整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收”。
-
这套方法可以泛化到任何爆款视频类型,不限于换装:“下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。”
-
评论区补上了这套方法的天花板:读者「王佳怡」指出”核心机关的拆解其实还是依赖人对原版视频的审美判断,要是 AI 漏掉了’留一秒钟空沙发镜头’这种细节,生成的视频直接就会穿帮,这套方法也不是所有爆款都能直接套用的。“——即 Skill 解决的是执行一致性,不解决”看出哪个细节是关键”的判断力。
实操内容保留
本文属工具操作型文章,含完整的分步教程与可直接复用的参数配置,按原文原样保留。
代码/配置
技能仓库与 API 入口(原文给出的地址)
# 桌面换装视频生成技能(开源)
https://github.com/liyupi/ai-desktop-outfit-video
# 作者开源教程仓库(本文收录其中)
https://github.com/liyupi/ai-guide
# API Key 获取入口(用于直接调 API 生成视频)
火山引擎官网 → 获取 API Key → 提供给 AI生成参数配置(原文「生成之前,有几个注意事项」原样保留)
比例:16:9 # 模拟电脑桌面
时长:30 秒 # Seedance 2.5 支持 30 秒
模式:默认「全能参考模式」 # 不要开任何运镜预设
清晰度:先 720p 试 → 满意后再上 1080p # 1080p 积分消耗贵可用的第三方 AI 视频工具(原文列举)
即梦 / 豆包 / MiniMax ...(只要支持 Seedance 模型或同级别视频模型即可)Prompt 模板
原文没有贴出完整的提示词全文(“在这个技能的开源项目中有完整版的参考提示词”),但给出了提问流程模板——即 Skill 向用户追问的六个槽位,可直接照抄成自建 Skill 的访谈脚本:
1. 主角是谁? # 默认:中国古典鹅蛋脸美人;可文字描述,也可上传参考图
2. 视频场景? # 默认:深蓝灰色调的房间
3. 三套换装造型? # 例:水手服 / 洛丽塔 / 白领制服
4. 视频里的台词? # 不喜欢默认台词可让 AI 按需求改写
5. 尺度档位? # 软 / 中 / 硬 三档
6. (由 AI 汇总)→ 输出完整提示词,投喂任意支持 Seedance 的视频工具起手的一句话需求(原文演示用句):
我想创作 30 秒的视频操作步骤
A. 手动复制提示词的出片流程(原文主线)
- 打开一个 AI 工具(文中用 Cursor),启用「AI 桌面换装视频」技能;
- 对 AI 说一句需求:“我想创作 30 秒的视频”;
- 依次回答 AI 的六个追问(主角 / 场景 / 三套造型 / 台词 / 尺度档位),中途可按需提供参考图;
- 把 AI 输出的完整提示词复制出来;
- 丢进任意支持 Seedance(或同级视频模型)的 AI 视频工具,按 16:9、30 秒、全能参考模式、无运镜预设、720p 试跑的参数生成;
- 效果满意后再用 1080p 重出高清版。
B. 直接调 API 生成的出片流程(原文第 4 节)
- 去火山引擎官网获取 API Key;
- 把 Key 提供给 AI;
- AI 调用 Seedance 2.5 API 生成视频并下载到本地;
- 全程无需打开任何 AI 视频生成工具。
- 注:换用其他视频生成模型的 API 同样可行。
C. 作者复刻爆款的方法论步骤(原文第 5 节「核心原理」)
- 找到爆火的原版视频;
- 把视频丢给 AI,让它逐帧分析画面与声音并生成简单直接的提示词(配合
/grill-me技能,需求不清时 AI 主动找人工确认); - 从逐帧分析中读出「机关」(例:镜头不动、起身不跟镜只拍腰部以下、换装前留一秒空沙发镜头);
- 让 AI 把机关整理成一段简洁的提示词模板;
- 拿模板到即梦测试验证;
- 验证通过后,让 AI 把整个工作流封装成可复用的 Skill(提问流程 + 提示词模板 + API 调用脚本全部自动生成);
- 让 AI 把技能开源到 GitHub,并自动生成含图文与 GIF 动图演示的 README。
配置/参数速查(作者给出的三套造型与场景示例)
| 槽位 | 默认值 | 作者本次选择 | 可 DIY 方式 |
|---|---|---|---|
| 主角 | 中国古典鹅蛋脸美人 | 用 ChatGPT 先生成参考图再提供给 AI | 文字描述 / 上传参考图 |
| 场景 | 深蓝灰色调的房间 | 安静的小酒吧 | 直接描述 |
| 三套造型 | (技能默认) | 水手服 / 洛丽塔 / 白领制服 | 直接描述 |
| 台词 | (技能默认) | 让 AI 改写为适配文案 | 直接描述 / 让 AI 改 |
| 尺度档位 | — | 软 / 中 / 硬三档可选 | 选档 |
关键概念
- Seedance 2.0 — 文中出片环节指定使用的视频模型家族(文中提及 Seedance 2.5 支持 30 秒时长,并提供 API);本素材补充了”Seedance 用作 30 秒桌面录屏风短片的执行层”这一新用法。
- AI Skill — 「AI 桌面换装视频」就是典型的 Skill 形态:把提问流程、提示词模板、API 调用脚本封装成可复用单元;本素材给出了”六问访谈 → 输出提示词”的具体 Skill 结构样本。
- grill-me — 作者在拆片阶段显式使用了
/grill-me技能,AI 理解不到位时主动找人工确认;本素材是 grill-me 在视频逆向工程场景(而非编程场景)的一次实战用法。 - 提示词工程 — 本文的提示词不是人写出来的,而是由 AI 通过结构化访谈生成;属于”把提示词生产本身流程化”的一种用法。
- 提示词模板 — Skill 的产出物即一段可复用的提示词模板(开源项目内含完整版参考提示词)。
- [待创建] AI 桌面换装视频 — 本文的题材主体:以”电脑桌面录屏”为视觉伪装、三套造型切换 + 对白 + 特效字幕、30 秒一镜到底的 AI 视频形态。核心机关是镜头不动、起身不跟镜(只拍到腰部以下)、换装前留一秒空沙发镜头。
- [待创建] AI 视频逐帧逆向工程 — 本文第 5 节的方法论:把爆款原片丢给 AI 做逐帧画面与声音分析,先拆出”机关”,再整理成提示词模板,最后封装成 Skill。
- [待创建] 即梦 / 火山引擎(视频生成 API) — 文中提到的出片工具与 API Key 来源;未建实体页,此处用纯文本标注。
- Cursor — 文中演示 Skill 调用所使用的 AI 工具。
- ChatGPT — 用于先生成主角参考图,再提供给 Skill。
- AI内容创作 / AI视频分镜 — 本素材属于 AI 视频内容生产的一条具体产线;与分镜方法相比,本文的重心在”整条片子作为一个镜头”的伪装式复刻。
与其他素材的关联
- 与 2026-07-07-woshipm-viral-ad-operations-four-levels、爆款广告复刻、爆款结构迁移 的关系:同属”复刻爆款”的方法族,但复刻对象与产物不同——四段位那篇复刻的是广告结构(人群/痛点/场景/证明/动作/收口),产物是一个可投放的结构变量表;本文复刻的是一条具体视频的视觉机关(镜头不动 / 起身不跟镜 / 换装前留空镜头),产物是一段提示词模板 + 一个 Skill。前者面向投放,后者面向单条内容的手感。
- 与 2026-07-23-woshipm-grill-me-skill、grill-me 的关系:同一作者的连续两篇,构成”同一个 Skill 的两种用法”——grill-me 篇讲它如何拷问需求做出一个软件产品(ChatGPT 文未提及的技能管理桌面应用),本文讲它如何作为视频逆向工程流程中的”需求澄清卡点”。两篇合看可以证明 grill-me 是领域无关的澄清协议(“泛化到非编程决策”在本文得到了第二个实证)。
- 与 2026-06-23-image2-seedance-long-video-brand-ad、Seedance 2.0 的关系:那篇讲 115 秒品牌长片的资产前置 + 尾帧衔接,解决的是”多镜头拼接一致性”;本文是单镜头 30 秒一镜到底的极简形态,反而不需要资产前置——用”镜头全程不动 + 只拍腰部以下”主动消除跨镜头一致性问题。两条路线互为边界案例。
- 与 2026-07-26-youtube-claude-product-photo-ad-campaign 的关系:都属”把视频生产从手工升级为可编排流水线”,但 Andy Lo 那篇的 Seedance 在四步流水线的第三步(静帧 → 短片动画),本文的 Seedance 则承担从提示词到成片的全部执行。
- 与 2026-08-11-codex-9-video-skills 的关系:都主张”视频创作 = 一组可复用 Skill”,差别在本文的 Skill 是单个、垂直、面向一个具体视频形态(桌面换装),而不是九个模块的组合管线。
- 与 2026-05-25-openclaw-deepseek-content-automation-sop、2026-06-22-personal-ip-4-things 的关系:那两篇关注内容生产的”量与运营”,本文关注单条内容的”工艺与复刻”;共同点是把重复判断沉淀成流程/模型而非靠灵感。
- 与 2026-09-21-woshipm-ai-text-garbage-internet 形成对照:那篇批评 AI 内容产能被用于批量制造垃圾;本文是同一产能的正向用法——用 AI 拆片 + 封 Skill 提高单条内容的工艺水平。输入端是”真实爆款原片 + 人的审美判断”,正好符合该主题”加速手段的正当性取决于输入端”的判据。
原文精彩摘录
最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。
视频里一个虚拟美女坐在电脑桌面上,你让她换什么衣服她就换什么衣服,还能对话。
果然,瑟瑟是第一生产力啊!
这个技能的玩法很简单。你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己又臭又长的提示词。
生成之前,有几个注意事项:比例选 16:9,因为是模拟电脑桌面;时长选 30 秒(Seedance 2.5 支持 30 秒);使用默认的全能参考模式就好,不要开任何运镜预设;建议先用 720p 来试,1080p 的积分消耗真的太贵了!等效果满意了再上高清。
AI 帮我拆出来了整条视频最核心的「机关」。比如镜头全程一动不动,人物站起来的时候镜头不跟,只拍到腰部以下,看起来就像真的是电脑桌面壁纸。还有每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。
最后我直接让 AI 帮我把这个技能开源到 GitHub 上,并且自动生成了一个有图有文、甚至有 GIF 动图演示的项目 README 文件。真的爽!
这也是得益于现在的 AI 模型 Agent 能力和视觉理解能力越来越强了。整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收。
下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。
(评论区 · 王佳怡)作者说整个流程几乎全由 AI 完成确实不假,把拆片、写提示词、封装这类脏活累活甩给 AI 能省不少时间,但核心机关的拆解其实还是依赖人对原版视频的审美判断,要是 AI 漏掉了’留一秒钟空沙发镜头’这种细节,生成的视频直接就会穿帮,这套方法也不是所有爆款都能直接套用的。