Studio0808 LiveCaption 本地 AI 即时双语字幕工具
Studio0808 LiveCaption 把浏览器分页面音频、语音识别、本地模型翻译和双语字幕叠加串成一条本机优先链路,让没有中文字幕的 Netflix 或海外串流内容也能接近实时地被理解。
基本信息
- 来源类型:文章
- 原文位置:raw/articles/2026-07-06-204234-tg-93a1ca.md
- 原文 URL:https://unwire.hk/2026/07/06/studio0808-livecaption-ai-subtitle-translation-netflix-vpn/software/
- 消化日期:2026-07-07
核心观点
- 浏览器字幕翻译可以从“平台供给”变成“用户本地生成”:文章的典型场景是用户用 VPN 跨区观看外国 Netflix、海外串流平台或外语电影网站,但片源未必提供中文字幕;Studio0808 LiveCaption 通过浏览器扩展直接抓取当前分页音频,再由本地 Python 后端做识别与翻译,绕开了平台字幕库是否覆盖中文的问题。
- 本机优先架构同时改善隐私和识别质量:工具不是用麦克风录电脑外放声音,而是直接擷取 Chrome 当前分页播放的音频数字输出,因此不会混入环境杂音或其他分页声音。音频处理、语音识别、翻译都围绕本机后端运行,和 数据主权 中“数据不离开自己控制环境”的原则一致。
- 识别层采用多引擎组合,覆盖亚洲语言与常见外语:工具整合 Whisper 多国语言识别引擎与 SenseVoice-Small 亚太语言识别引擎,支持中文、英文、日文、韩文、粤语,以及法文、德文、西班牙文、意大利文、俄文等语言;再搭配 Silero VAD 语音活动检测,在侦测到一句话结束时自动断句并生成字幕。
- 翻译层用 Ollama 本地模型在速度和质量之间取舍:教程建议用
ollama run qwen2.5:3b-instruct或ollama run qwen2.5:7b-instruct预先下载模型。7B 翻译质量最好,3B 速度更快;如果不熟悉电脑硬件配置,可以先试 3B,觉得翻译不理想再换 7B。 - 实时性仍受本机硬件限制,体验不是“云端级无感”:实测总结提醒,3B 或 7B 模型在不同电脑上可能出现字幕慢一句的情况,用户需要根据硬件规格测试模型与流畅度。它的价值不是绝对同步,而是用免费开源工具把“原本完全没有中文字幕”的内容变成可理解。
实操内容保留
代码/配置
ollama run qwen2.5:3b-instruct
ollama run qwen2.5:7b-instructPrompt 模板
(本文无 Prompt 模板。)
操作步骤
- 到 Ollama 官网下载安装 Ollama:https://ollama.com/download。
- 在 Terminal 复制执行模型下载命令:
ollama run qwen2.5:3b-instruct或ollama run qwen2.5:7b-instruct。开发者建议 7B 翻译质量最佳,3B 运行速度较快;硬件不确定时先从 3B 开始。 - 到 Studio0808 LiveCaption 下载页取得工具:https://begin0808.github.io/LiveCaption_Global/。
- 解压 Windows 一键执行离线整合包,里面包含
LiveCaptionServer本机服务器资料夹与extensionChrome 扩展资料夹。 - 进入
LiveCaptionServer资料夹,双击LiveCaptionServer.exe启动服务器。若 Windows 出现蓝色安全防护画面,点击“其他资讯”,再按“仍要执行”。 - 等画面出现
running on http://127...字样,表示本机服务器已启用。使用期间必须保持这个视窗开启,不能关闭。 - 打开 Chrome 或 Chromium 浏览器(如 Edge、Brave),进入扩展功能管理页,开启“开发人员模式”。
- 点击“载入未封装项目”,选择解压出的
extension资料夹,将 Studio0808 LiveCaption 匯入浏览器,并可钉选到右上角方便调用。 - 播放外语影片时,点击扩展图标,按下“启动即时字幕”。影片来源语言通常维持“自动侦测”,再选择语音识别引擎即可开始双语字幕翻译。
关键概念
- Studio0808 LiveCaption — 本文介绍的免费开源本地 AI 双语字幕工具。
- 本地AI字幕翻译 — 将分页面音频、本地语音识别、本地翻译模型和字幕叠加组合成实时理解链路的方法。
- Whisper — Studio0808 LiveCaption 集成的多国语言语音识别引擎之一。
- Ollama — 负责在本地拉取并运行 Qwen 2.5 3B / 7B 翻译模型。
- 数据主权 — 本机优先、不依赖云端字幕与翻译服务的隐私和可控性原则。
- SenseVoice-Small — 文中提到的亚太语言识别引擎,支持中文、日文、韩文、粤语等场景。
- Silero VAD — 文中提到的语音活动检测组件,用于判断一句话何时结束并自动断句。
与其他素材的关联
- 与 2026-05-27-woshipm-personalized-ai-reading-assistant 的关系:两者都把 AI 能力拉回本地运行,前者用于个性化读书,本文用于影音字幕翻译;共同点是数据留在本机、用户掌握资料和工具链,而不是依赖平台供给。
- 与 2026-04-29-deepseek-python-local-setup 和 Ollama 相关素材的关系:既有素材主要把 Ollama 用于本地编程、知识库或原型验证;本文补充了“本地模型作为实时影音翻译层”的消费级应用场景。
- 与 AI办公自动化 的关系:既有办公自动化素材强调 Office、Workspace、Connector 与跨 SaaS 任务链;本文把“自动化”扩展到学习、观影和跨语言信息获取场景,体现本地 AI 工具也可以替用户自动处理媒介理解成本。
原文精彩摘录
有時為觀看某些地區限定的電影或劇集,會利用 VPN「飛」到外國 Netflix 或是其他海外串流平台。不過外國限定影片未必提供中文字幕,看外語時總會有些吃力。其實只要利用一款免費開源工具「Studio0808 LiveCaption」,就能輕鬆解決問題。
Studio0808 LiveCaption 是專為瀏覽器影片打造的即時雙語字幕工具,讓用家在網頁觀看內容時,可以即時取得語音辨識字幕與翻譯結果。工具採用「本機優先」運作架構,透過 Chrome 擴充功能直接擷取目前分頁播放的音訊數碼輸出,再將音訊串流傳送到本機 Python 後端處理。好處是毋須動用電腦麥克風,因此不會錄到環境雜音或其他分頁聲音,大大提升辨識準確度。
工具整合了 Whisper 多國語言辨識引擎與 SenseVoice-Small 亞太語言辨識引擎,支援中文、英文、日文、韓文、粵語,以及法文、德文、西班牙文、意大利文、俄文等多種語言。搭配 Silero VAD 語音活動偵測,系統能在偵測到一句話結束時自動斷句,並快速產生字幕。
不過需要留意,視乎每部電腦硬件效能,在使用 3B 或 7B 模型進行測試時,部分影片可能未臻完美即時同步效果,翻譯後雙語字幕有機會出現慢了一句情況。大家在實際使用時可以自行測試,並根據個人電腦規格調整模型,以找出最適合自己的流暢度。