PennyScribe

一款面向 AI Agent 和开发者的云端音频转写服务,提供 CLI、API 和 MCP 三种接口,由大侠Luffy 用 Codex 从零开发完成。

简介

PennyScribe 是一个音频/视频语音转写服务,特别设计为对 AI Agent 友好。它可以将音频、视频中的语音快速转换为结构化文本,再交给 Agent 完成内容总结、知识提取、信息检索和自动化处理。与传统的本地 ASR 方案(如先下载运行 Whisper)相比,PennyScribe 的云端优势在于无需本地 GPU、处理速度快、支持批量并行处理。

PennyScribe 的开发者大侠Luffy 全程使用 Codex 编写代码,自己一行代码未写。他放弃了 Vast.ai 官方的 Serverless 方案,用 Codex 从零构建了一套 GPU 实例调度系统,在两周内完成了原本估计需要 3 个月的工作。

关键信息

核心特性

三接口设计

PennyScribe 最核心的差异化特性是多接口支持:

  1. CLI(命令行接口):供开发者和自动化脚本直接调用
  2. API:供应用程序和 AI 工作流集成
  3. MCP(Model Context Protocol):让 AI Agent 可以直接发现和调用转写能力

这种”对人 + 对 Agent”双友好的设计,体现了 AI Agent 时代的产品新范式:产品的功能不应当只封闭在 UI 里,还应暴露为可被 AI 代理调用的接口。

AI Agent 友好设计

  • 无需本地部署模型(不像 Whisper 需要在本地下载运行)
  • 标准化接口方便 Agent 工作流集成
  • 云端多 GPU 并行处理支持批量任务
  • 专注高质量纯文本转写,不做多余功能

技术架构

  • 转写引擎:Qwen ASR(纯文本转写效果好)
  • GPU 调度:自建 GPU 实例调度系统(基于 Vast.ai,放弃官方 Serverless)
  • 暂不支持:视频字幕制作(Qwen ForcedAligner 时间戳效果不理想)

不同素材中的观点

  • 2026-08-12-pennyscribe-codex-ai-product(大侠Luffy):这是 PennyScribe 首次公开亮相。作者的核心观点是”产品不仅要方便人使用,也应该让 AI 能够轻松发现、理解和调用”。PennyScribe 被定位为 “Agent 友好的云端语音转写服务”,填补了当前 ChatGPT/Claude Code 处理音频转写任务时需本地部署 Whisper 的痛点——处理时间长、设备性能不足、网络中断等问题。Qwen ASR 的转写文本质量出色,但时间戳效果不理想,因此现阶段专注纯文本转写。GPU 调度效率和转写吞吐量仍有优化空间,作者计划继续优化架构并降低成本。

实用信息

  • 快速上手:通过 CLI 调用转写命令;或通过 API 在应用程序中集成;或通过 MCP 协议让 AI Agent 直接调用
  • 适用场景:访谈转写、播客文字化、通话记录、课程录音转文本、AI Agent 工作流中的音频处理环节
  • 不适用场景:视频字幕制作(缺少高精度时间戳)、需要本地离线处理的场景
  • 注意事项:面向批量处理场景优势更明显(云端多 GPU 并行);单次小音频的处理速度优势不大

相关页面