很多时候,给视频加字幕并不难,真正麻烦的是后面的翻译。
尤其是遇到一段没有字幕的英文、日文、韩文视频,你通常得先找工具转字幕,再把 SRT 文件丢进翻译工具,最后还要检查时间轴有没有乱。WhisperSubTranslate 想做的事情很直接:把“语音识别 → 生成字幕 → 翻译”这几步合在一个桌面软件里。
它是一个免费的开源桌面应用。把视频拖进去之后,软件会利用 whisper.cpp 把视频里的语音转成 SRT 字幕,然后再把字幕翻译成其他语言。整个过程可以在本地电脑完成,视频不需要上传到云端,也不用注册账号。
GitHub项目地址:https://github.com/Blue-B/WhisperSubTranslate

这里有个细节很重要:它并不是“提取视频里原本就存在的字幕”。如果你的 MP4 里面已经内置了一条字幕轨道,WhisperSubTranslate 不会直接把它扒出来;它做的是重新听视频里的声音,然后通过语音识别生成字幕。同样,它也不支持 OCR,所以画面里烧录的字幕也不会被识别。
核心技术用的是 Whisper 生态里的 whisper.cpp。简单理解,就是让电脑自己完成“听懂视频说了什么”这件事。软件提供 tiny、base、small、medium、large-v3 等不同模型,其中默认的 large-v3-turbo 大约需要 2GB 显存,比较适合在普通独显电脑上使用;如果电脑配置一般,也可以选择更小的模型。没有 NVIDIA 显卡也不是完全不能用,它支持 CPU 运行,只是速度会慢一些。
翻译部分则是这个项目比较有意思的地方。
它现在自带腾讯的 Hy-MT2 本地翻译模型,默认的 1.8B 版本大约需要 2GB 显存或 4GB 内存,模型体积约 1.13GB。还有一个更大的 7B 版本,对硬件要求会明显高一些,需要大约 8GB 显存或 12GB 内存。只要使用本地 Hy-MT2,不用 API Key、不需要联网,也没有按次收费的问题。
当然,如果你更看重翻译效果,也可以接入 DeepL、OpenAI、Gemini、Claude 等在线服务,不过这些需要自己准备对应的 API Key。项目还支持 OpenAI 兼容接口,所以如果你已经在用 OpenRouter、Ollama、vLLM 之类的服务,也可以接进来。
用内置的 Tencent Hy-MT2 模型完全离线翻译,或用自己的 API 密钥使用免费/付费在线引擎。
| 引擎 | 离线 | API 密钥 | 费用 | 备注 |
|---|---|---|---|---|
| Hy-MT2 1.8B (本地,默认) | 是 | 不需要 | 免费 | 约1.13GB,显存 2GB / 内存 4GB,端侧 |
| Hy-MT2 7B (本地) | 是 | 不需要 | 免费 | 约6.16GB,显存 8GB / 内存 12GB,更大模型 |
| MyMemory | 否 | 不需要 | 免费 | 每 IP 每天约5万字符 |
| DeepL | 否 | 需要 | 每月50万字符免费 | 输出稳定 |
| OpenAI GPT-5.x (可配置,默认 gpt-5.6-sol) | 否 | 需要 | 付费 | 默认模型,上下文感知 |
| Gemini 3.x (可配置,默认 gemini-3.6-flash) | 否 | 需要 | 免费 / 低成本 | 推荐的低成本路线 (获取密钥) |
| Claude (可配置,默认 claude-opus-5) | 否 | 需要 | 付费 | 上下文理解出色 (获取密钥) |
| 自定义 OpenAI 兼容提供商 | 否 | 需要 | 各异 | 自带端点 (OpenRouter、Ollama、vLLM 等) |
只有本地 Hy-MT2 引擎无需 API 密钥、无需网络、无每次费用,台词不会离开你的电脑。

字幕不同步也是视频处理里非常烦人的问题。WhisperSubTranslate 针对这个问题准备了 large-v2 Sync 和 Sync Lite 两个模型。普通模型出现时间轴漂移时,可以换它们重新处理,尤其针对日语、韩语、中文等非英语视频,项目作者特别强调了同步效果。代价也很明显:Sync 模型需要额外下载大约 4.4GB 的组件和模型。
实际使用门槛倒不算高。Windows 用户下载 Release 里的便携版,解压后直接运行 WhisperSubTranslate.exe 就行,不需要自己装 Python,也不用手动配置 Whisper。模型会根据需要自动下载。
但它也不是那种“下载几十 MB,什么电脑都能飞快跑”的小工具。模型本身就可能占几百 MB 到几 GB,想用大模型获得更好的识别效果,对显卡和硬盘空间还是有要求的。特别是第一次使用时,需要下载模型,别看到软件体积小就以为整个工具只占这么点空间。
从项目状态来看,它目前已经有 500 多个 Star、40 多个 Fork,并且仓库有 180+ 次提交,代码以 JavaScript 为主,采用 Electron 这类技术做桌面应用。
我觉得它比较适合两类人:一类是经常处理外语视频、需要自己制作字幕的人;另一类是比较在意隐私,不希望把私人视频上传到在线 AI 服务的人。
如果只是偶尔给一个短视频加字幕,在线工具可能更省事。但如果你手里有一堆课程、采访、纪录片或者外语视频,需要反复批量处理,WhisperSubTranslate 这种“本地跑、没有次数限制”的方案就很有吸引力。
而且它最大的优势其实不是“AI 翻译有多神”,而是把原本零零散散的几个工具串到了一起:视频丢进去,字幕出来,再翻译成目标语言。 对普通用户来说,这种简单粗暴的工作流,反而挺实用。


























