edge-tts

微软 Edge 浏览器内置的免费文字转语音(TTS)服务,通过开源 CLI 工具 edge-tts 可在命令行中调用,支持多种中文语音,常用于视频配音、AI 自动化配音场景

简介

edge-tts 是一个基于微软 Edge 浏览器”大声朗读”功能的开源命令行工具,提供免费的文本转语音能力。它通过模拟 Edge 浏览器的 TTS 请求来调用微软的云端语音合成服务,无需 API Key 或付费账号。

在 AI 自动化视频创作场景中,edge-tts 被 Creator Buddy 的 space-video-audio Skill 作为免费配音引擎使用——当用户不想露声时,将脚本文字转为旁白音频。由于其完全免费的特性,edge-tts 显著降低了视频创作流程的成本门槛。

与商业 TTS 服务(如 ElevenLabs、MiniMax TTS)相比,edge-tts 的优势在于零成本和零注册门槛,但声音自然度和可控性不如付费方案。在需要高质量 AI 配音的终稿场景中,创作者通常将 edge-tts 用于草稿和内部预览,将 ElevenLabs 等用于最终交付。但在成本敏感或个人项目场景中,edge-tts 已足够应付大多数需求。

关键信息

核心特性

  • 完全免费:无需注册或 API Key,通过模拟 Edge 浏览器的 TTS 接口调用
  • 多语言多语音:支持微软 Edge 朗读引擎的全部语音,包括中文普通话的多种声音(如 zh-CN-XiaoxiaoNeural、zh-CN-YunxiNeural 等)
  • 命令行调用:可直接通过 edge-tts --text "文本" --voice zh-CN-XiaoxiaoNeural --write-media output.mp3 生成音频文件
  • 支持 SSML:支持语音合成标记语言(SSML)实现语速、音调、停顿等精细控制
  • 交互式语音选择:运行 edge-tts --list-voices 查看所有可用语音,支持按语言过滤(如 edge-tts --list-voices | grep zh-CN 列出所有中文普通话语音)
  • 流式播放:支持 edge-playback --text "文本" --voice zh-CN-XiaoxiaoNeural 直接在终端播放,无需保存文件

在 Creator Buddy 视频流水线中的定位

在 space-video-audio Skill 中,edge-tts 被用于”不想露声”场景的文本转旁白。配合 Pixabay 免版权 BGM 检索和压音混音处理,edge-tts 的配音 + 背景音乐 + -14 LUFS 归一化形成完整的音频处理链。对比 ElevenLabs(付费、声音更自然、支持声音克隆)和 MiniMax TTS(中文表现好但需 API Key),edge-tts 是零成本方案中质量最接近可用的选择。

不同素材中的观点

  • 2026-08-11-codex-9-video-skills:在 Creator Buddy 视频流水线中作为 space-video-audio Skill 的 TTS 引擎,解决”不想露声”的配音需求。属于不需要第三方付费 API 的免费依赖,降低了视频创作成本。

相关页面