我用 Codex 自动剪视频,全靠这 9 个视频 Skills

iThinkAi 在掘金分享的基于 Creator Buddy(SpaceZephyr 开源项目)的 9 个视频创作 AI Skill,将视频制作全流程拆解为可自动运行的模块化流水线,从选题、脚本、剪辑到封面,覆盖口播视频的完整生产链路。同时推荐了红鸦 AI 的小红书图文 Skill 作为配套工具。

核心观点

  1. 视频制作全流程可拆解为 9 个独立 Skill:作者将视频创作的繁琐步骤系统化分解为选题拆解(topic)、脚本生成(script)、字幕断句(subtitle)、导演总控(video)、口播剪辑(edit)、配音配乐(audio)、代码动效(broll)、手绘白板(broll-sketch)和模块化封面(cover),每个 Skill 独立负责一个环节,降低了 AI 处理复杂任务的出错率。

  2. “删前保后”口播剪辑逻辑:space-video-edit Skill 的处理方式是将口播视频先转成文本,识别口误、语气词和静音片段,采用”删前保后”原则——因为人说错了通常会在后面重新说一遍完整的,前面的口误直接切掉,保留后面流畅的版本并重新对齐字幕。

  3. “压音”混音技术实现无需重编码的声音处理:space-video-audio Skill 自动检索 Pixabay 免版权曲库的背景音乐,人声出现时背景音乐自动降低(压音),人声停止时音乐拉大,响度统一归一化到 -14 LUFS,整个过程不重新编码视频,秒级出片。

  4. 代码动效解决 B-roll 素材痛点:space-video-broll Skill 将口播内容映射为视觉隐喻(如河流代表流量、坍缩代表数据精简),用纯 HTML/CSS 生成 30 秒以上的连续动效,逐帧渲染为 MP4,绝对原创、无版权风险。

  5. 红鸦 AI 打通 Agent 终端与网页端:红鸦小红书图文 Skill 可从主题开始,自动生成大纲、标题、正文、逐页图片大纲和生图提示词,支持普通图文和商品带货两种模式,Agent 终端(Codex/WorkBuddy/Claude Code)与网页端共用账号和积分,生成历史双向同步。

实操内容保留

红鸦小红书图文 Skill 安装方法

请帮我安装「红鸦小红书图文」能力到当前 AI 环境:

1. 下载 https://hy.ithinkai.cn/openapi/skill.md 的内容,保存为 ~/.claude/skills/redya-xiaohongshu/SKILL.md
2. 设置环境变量 REDYA_API_KEY=rk-你的APIKey
3. 设置环境变量 REDYA_BASE_URL=https://hy.ithinkai.cn

装好后我要用它生成小红书图文笔记。

Creator Buddy 视频 Skill 安装命令

帮我安装这几个 Skill:github.com/SpaceZephyr/creator-buddy/tree/main/video-skills

三条视频创作链路

  • 链路 A(完整口播)选题 (topic) -> 脚本 (script) -> 录制 -> 剪辑 (edit) -> 动效 (broll) -> 字幕 (subtitle) -> 配音配乐 (audio) -> 封面 (cover)
  • 链路 B(爆款模仿)用 topic 下载参考视频和逐字稿 -> 拆解结构 -> 重新写自己的脚本
  • 链路 C(图文转视频)手绘图解 (broll-sketch) -> 自动配音配乐 (audio) -> 封面 (cover)

免费 TTS 依赖

space-video-audio 调用 edge-tts(微软 Edge 免费文字转语音服务),不会产生第三方 API 费用。大部分 Skill 不需要付费 API,只有视频下载和视频模型生成需要配置对应 Key。

9 个视频 Skill 详表

Skill 名称功能分组关键依赖
space-video-topic爆款拆解器:无水印下载视频、逐字稿生成、选题结构拆解脑力解放yt-dlp
space-video-script去 AI 味脚本:口语化重构、分镜脚本脑力解放-
space-video-subtitle呼吸感字幕:口播式断句、错别字校对、SRT/ASS 输出脑力解放-
space-video导演总控:需求澄清、子 Skill 调度社恐拯救其他子 Skill
space-video-edit无痛剪口播:转文本、识别口误静音、“删前保后”原则社恐拯救-
space-video-audio智能调音师:TTS、压音混音、-14 LUFS 归一化社恐拯救edge-tts, Pixabay
space-video-broll代码动效:视觉隐喻映射、HTML/CSS 动效、逐帧渲染 MP4视觉外包HTML/CSS 渲染
space-video-broll-sketch手绘白板图解:逻辑拆解 6-10 帧、白底黑线蓝点缀视觉外包火山引擎 Seedance, libtv
space-video-cover模块化封面:固定主色调/字体/排版、多平台尺寸输出视觉外包-

关键概念

  • Codex:文章目标运行平台,通过安装 Creator Buddy 视频 Skills 实现自动化
  • AI Skill:9 个视频创作工作流的封装形式
  • Creator Buddy:SpaceZephyr 开源的视频创作 Skill 合集,需新建实体页
  • 红鸦AI:小红书图文生成工具,Agent 终端和网页端打通,需新建实体页
  • WorkBuddy:文章提到的主流 Agent 工具之一,可安装运行这些 Skills
  • edge-tts:微软 Edge 免费 TTS,需新建实体页
  • 火山引擎 Seedance:手绘白板图后台生成引擎
  • libtv:手绘白板图 Agent 通道

原文精彩摘录

做视频这事,真不是人干的。以前我觉得写文章就够掉头发了,直到自己开始折腾视频。写完脚本,录制时对着镜头疯狂卡壳;好不容易录完,剪辑时要一帧帧去听哪里说了”呃”、“那个”;接着还要满世界找不侵权的 B-roll 画面、配背景音乐、做字幕……一整套流程走下来,半条命都没了。

AI 写脚本最大的毛病就是”不像人话”。动不动就是”在这瞬息万变的时空里”,念起来能把人憋死。这个 Skill 的核心逻辑就是”说人话”。它会把书面语自动重构成适合镜头前表达的口语。比如把那些宏大的排比句,改成”今天聊个大实话”。

这个 Skill 的处理方式非常聪明:先将视频转成文本,识别出里面的口误、语气词和静音片段。然后它采用”删前保后”的原则——因为人说错了,往往会在后面重新说一遍完整的。它会把前面的口误和废话直接切掉,把流畅的片段拼起来,连带着把字幕也重新对齐。

与其他素材的关联