我用 Codex 自动剪视频,全靠这 9 个视频 Skills
iThinkAi 在掘金分享的基于 Creator Buddy(SpaceZephyr 开源项目)的 9 个视频创作 AI Skill,将视频制作全流程拆解为可自动运行的模块化流水线,从选题、脚本、剪辑到封面,覆盖口播视频的完整生产链路。同时推荐了红鸦 AI 的小红书图文 Skill 作为配套工具。
核心观点
-
视频制作全流程可拆解为 9 个独立 Skill:作者将视频创作的繁琐步骤系统化分解为选题拆解(topic)、脚本生成(script)、字幕断句(subtitle)、导演总控(video)、口播剪辑(edit)、配音配乐(audio)、代码动效(broll)、手绘白板(broll-sketch)和模块化封面(cover),每个 Skill 独立负责一个环节,降低了 AI 处理复杂任务的出错率。
-
“删前保后”口播剪辑逻辑:space-video-edit Skill 的处理方式是将口播视频先转成文本,识别口误、语气词和静音片段,采用”删前保后”原则——因为人说错了通常会在后面重新说一遍完整的,前面的口误直接切掉,保留后面流畅的版本并重新对齐字幕。
-
“压音”混音技术实现无需重编码的声音处理:space-video-audio Skill 自动检索 Pixabay 免版权曲库的背景音乐,人声出现时背景音乐自动降低(压音),人声停止时音乐拉大,响度统一归一化到 -14 LUFS,整个过程不重新编码视频,秒级出片。
-
代码动效解决 B-roll 素材痛点:space-video-broll Skill 将口播内容映射为视觉隐喻(如河流代表流量、坍缩代表数据精简),用纯 HTML/CSS 生成 30 秒以上的连续动效,逐帧渲染为 MP4,绝对原创、无版权风险。
-
红鸦 AI 打通 Agent 终端与网页端:红鸦小红书图文 Skill 可从主题开始,自动生成大纲、标题、正文、逐页图片大纲和生图提示词,支持普通图文和商品带货两种模式,Agent 终端(Codex/WorkBuddy/Claude Code)与网页端共用账号和积分,生成历史双向同步。
实操内容保留
红鸦小红书图文 Skill 安装方法
请帮我安装「红鸦小红书图文」能力到当前 AI 环境:
1. 下载 https://hy.ithinkai.cn/openapi/skill.md 的内容,保存为 ~/.claude/skills/redya-xiaohongshu/SKILL.md
2. 设置环境变量 REDYA_API_KEY=rk-你的APIKey
3. 设置环境变量 REDYA_BASE_URL=https://hy.ithinkai.cn
装好后我要用它生成小红书图文笔记。
Creator Buddy 视频 Skill 安装命令
帮我安装这几个 Skill:github.com/SpaceZephyr/creator-buddy/tree/main/video-skills
三条视频创作链路
- 链路 A(完整口播):
选题 (topic) -> 脚本 (script) -> 录制 -> 剪辑 (edit) -> 动效 (broll) -> 字幕 (subtitle) -> 配音配乐 (audio) -> 封面 (cover) - 链路 B(爆款模仿):
用 topic 下载参考视频和逐字稿 -> 拆解结构 -> 重新写自己的脚本 - 链路 C(图文转视频):
手绘图解 (broll-sketch) -> 自动配音配乐 (audio) -> 封面 (cover)
免费 TTS 依赖
space-video-audio 调用 edge-tts(微软 Edge 免费文字转语音服务),不会产生第三方 API 费用。大部分 Skill 不需要付费 API,只有视频下载和视频模型生成需要配置对应 Key。
9 个视频 Skill 详表
| Skill 名称 | 功能 | 分组 | 关键依赖 |
|---|---|---|---|
| space-video-topic | 爆款拆解器:无水印下载视频、逐字稿生成、选题结构拆解 | 脑力解放 | yt-dlp |
| space-video-script | 去 AI 味脚本:口语化重构、分镜脚本 | 脑力解放 | - |
| space-video-subtitle | 呼吸感字幕:口播式断句、错别字校对、SRT/ASS 输出 | 脑力解放 | - |
| space-video | 导演总控:需求澄清、子 Skill 调度 | 社恐拯救 | 其他子 Skill |
| space-video-edit | 无痛剪口播:转文本、识别口误静音、“删前保后”原则 | 社恐拯救 | - |
| space-video-audio | 智能调音师:TTS、压音混音、-14 LUFS 归一化 | 社恐拯救 | edge-tts, Pixabay |
| space-video-broll | 代码动效:视觉隐喻映射、HTML/CSS 动效、逐帧渲染 MP4 | 视觉外包 | HTML/CSS 渲染 |
| space-video-broll-sketch | 手绘白板图解:逻辑拆解 6-10 帧、白底黑线蓝点缀 | 视觉外包 | 火山引擎 Seedance, libtv |
| space-video-cover | 模块化封面:固定主色调/字体/排版、多平台尺寸输出 | 视觉外包 | - |
关键概念
- Codex:文章目标运行平台,通过安装 Creator Buddy 视频 Skills 实现自动化
- AI Skill:9 个视频创作工作流的封装形式
- Creator Buddy:SpaceZephyr 开源的视频创作 Skill 合集,需新建实体页
- 红鸦AI:小红书图文生成工具,Agent 终端和网页端打通,需新建实体页
- WorkBuddy:文章提到的主流 Agent 工具之一,可安装运行这些 Skills
- edge-tts:微软 Edge 免费 TTS,需新建实体页
- 火山引擎 Seedance:手绘白板图后台生成引擎
- libtv:手绘白板图 Agent 通道
原文精彩摘录
做视频这事,真不是人干的。以前我觉得写文章就够掉头发了,直到自己开始折腾视频。写完脚本,录制时对着镜头疯狂卡壳;好不容易录完,剪辑时要一帧帧去听哪里说了”呃”、“那个”;接着还要满世界找不侵权的 B-roll 画面、配背景音乐、做字幕……一整套流程走下来,半条命都没了。
AI 写脚本最大的毛病就是”不像人话”。动不动就是”在这瞬息万变的时空里”,念起来能把人憋死。这个 Skill 的核心逻辑就是”说人话”。它会把书面语自动重构成适合镜头前表达的口语。比如把那些宏大的排比句,改成”今天聊个大实话”。
这个 Skill 的处理方式非常聪明:先将视频转成文本,识别出里面的口误、语气词和静音片段。然后它采用”删前保后”的原则——因为人说错了,往往会在后面重新说一遍完整的。它会把前面的口误和废话直接切掉,把流畅的片段拼起来,连带着把字幕也重新对齐。
与其他素材的关联
- 2026-07-27-tiktok-codex-agent-skills 同属 Codex Skill 应用案例
- 2026-08-10-ai-skill-productization-experience 同属 AI Skill 产品化方法论
- 2026-08-12-workbuddy-libtv 提到了 libtv(同一条依赖链)