PennyScribe
一款面向 AI Agent 和开发者的云端音频转写服务,提供 CLI、API 和 MCP 三种接口,由大侠Luffy 用 Codex 从零开发完成。
简介
PennyScribe 是一个音频/视频语音转写服务,特别设计为对 AI Agent 友好。它可以将音频、视频中的语音快速转换为结构化文本,再交给 Agent 完成内容总结、知识提取、信息检索和自动化处理。与传统的本地 ASR 方案(如先下载运行 Whisper)相比,PennyScribe 的云端优势在于无需本地 GPU、处理速度快、支持批量并行处理。
PennyScribe 的开发者大侠Luffy 全程使用 Codex 编写代码,自己一行代码未写。他放弃了 Vast.ai 官方的 Serverless 方案,用 Codex 从零构建了一套 GPU 实例调度系统,在两周内完成了原本估计需要 3 个月的工作。
关键信息
- 类型:工具 / SaaS 服务
- 领域:自动语音识别(ASR)、AI Agent 基础设施
- 官方网站:https://pennyscribe.com/
- 转写模型:Qwen ASR(阿里通义千问语音识别模型)
- GPU 算力来源:Vast.ai
- 开发者:大侠Luffy(掘金作者)
- 相关概念:Whisper、Qwen ASR、Vast.ai、Codex、AI Agent 智能体、MCP 模型上下文协议
核心特性
三接口设计
PennyScribe 最核心的差异化特性是多接口支持:
- CLI(命令行接口):供开发者和自动化脚本直接调用
- API:供应用程序和 AI 工作流集成
- MCP(Model Context Protocol):让 AI Agent 可以直接发现和调用转写能力
这种”对人 + 对 Agent”双友好的设计,体现了 AI Agent 时代的产品新范式:产品的功能不应当只封闭在 UI 里,还应暴露为可被 AI 代理调用的接口。
AI Agent 友好设计
- 无需本地部署模型(不像 Whisper 需要在本地下载运行)
- 标准化接口方便 Agent 工作流集成
- 云端多 GPU 并行处理支持批量任务
- 专注高质量纯文本转写,不做多余功能
技术架构
- 转写引擎:Qwen ASR(纯文本转写效果好)
- GPU 调度:自建 GPU 实例调度系统(基于 Vast.ai,放弃官方 Serverless)
- 暂不支持:视频字幕制作(Qwen ForcedAligner 时间戳效果不理想)
不同素材中的观点
- 2026-08-12-pennyscribe-codex-ai-product(大侠Luffy):这是 PennyScribe 首次公开亮相。作者的核心观点是”产品不仅要方便人使用,也应该让 AI 能够轻松发现、理解和调用”。PennyScribe 被定位为 “Agent 友好的云端语音转写服务”,填补了当前 ChatGPT/Claude Code 处理音频转写任务时需本地部署 Whisper 的痛点——处理时间长、设备性能不足、网络中断等问题。Qwen ASR 的转写文本质量出色,但时间戳效果不理想,因此现阶段专注纯文本转写。GPU 调度效率和转写吞吐量仍有优化空间,作者计划继续优化架构并降低成本。
实用信息
- 快速上手:通过 CLI 调用转写命令;或通过 API 在应用程序中集成;或通过 MCP 协议让 AI Agent 直接调用
- 适用场景:访谈转写、播客文字化、通话记录、课程录音转文本、AI Agent 工作流中的音频处理环节
- 不适用场景:视频字幕制作(缺少高精度时间戳)、需要本地离线处理的场景
- 注意事项:面向批量处理场景优势更明显(云端多 GPU 并行);单次小音频的处理速度优势不大