很多日语内容压根没有字幕轨。日本那边的视频平台不少是不提供字幕的,直播更是从来没有,老剧、 讲座、访谈、播客也一样——不是字幕组来不及做,而是源头就没有字幕文件。机器翻译的水平已经 够用了,难点卡在前一步:先把声音变成文字。
这篇讲在 Windows 上怎么做:挑工具该看哪几点、我做的这个怎么用,以及它做不到什么。
不管最后用哪个,合不合用基本由这几条决定:
Windows 自带实时字幕(Win + Ctrl + L)。取决于你的硬件和 Windows 版本,它可能已经能 满足一部分需求,而且不花钱。它的能力每个 Windows 版本都在变,所以请看 微软官方页面 确认当前支持情况,而不是任何第三方的对比文章(包括本文)。够用的话,你不需要再装别的。
浏览器插件适合「要看的东西全在浏览器里」的人,注意其中不少会把声音传到服务器。云端转写服务 精度不错,但要上传文件、等结果,帮不了你今晚这场直播。
RealSub 抓取电脑正在播放的声音,在本地识别成 文字,可选翻译,然后用一条点击穿透的字幕条显示在所有窗口最上层。本体免费,转录不限次数。
1. 装好、走一遍首次运行向导。 它会检查硬件,然后问两个语言:你在听的(日语)和你想读的 (中文,简体或繁体)。识别模型内置在软件里,不用下载、不用注册、不用 API key。
2. 选声音来源。 整机,或者指定某一个应用。后者值得花一分钟学会:选中播放器或浏览器, 就只有它的声音进识别,QQ / Discord 的提示音、后台另一个视频都不会混进字幕。没出过声的应用 不会出现在列表里。
3. 开始播放,摆好字幕条。 字幕条点击穿透,不挡下面的播放器操作。鼠标悬停会浮出边框,可以 拖动和缩放;字体、字号、颜色、不透明度都在设置里。
你会看到日文原文在对方还在说的时候就出现,中文译文慢一拍跟上。
识别跑在显卡上。GTX 10 系、2GB 显存起步,4GB 以上更从容。A 卡和 Intel 核显走 Vulkan, 首次运行会做一次简短的性能测试,通过了才启用。没有可用显卡时退到 CPU 模式、换用较小的模型—— 能用,但精度明显下降、延迟明显变长。它没有「转去云端」这条后路,这是有意的:声音不出你的电脑。
装之前先知道:
在我自建的测试集(TED、新闻、动画、讲座、直播录像)上测出来是日语 92%、英语 98%、 中文 93%。这是我自己测试集上的内部数字,不是什么官方跑分,实际能到多少完全取决于素材: 单人清晰讲话远高于这个数,带 BGM 的多人闲聊低于这个数。
唯一靠谱的判断方式是拿你自己常看的东西试十分钟。转录在免费版里不限次数,就是为了让你先 试过再决定翻译值不值得花钱。
什么播放器都能用吗? 它取的是 Windows 正在播放的声音,所以跟播放器无关——本地播放器、浏览器、直播客户端、下载的 视频、游戏都一样。
能只出日文字幕、不要翻译吗? 能,而且这部分免费。关掉翻译就只出日文原文,学日语的人要的往往正是这个。
声音会被上传吗? 音频永远不会。开着翻译时,只有识别出来的文本会发给你选的翻译服务;关掉翻译、或者指向你自己的 本机服务,就什么都不出去。隐私政策里按路径逐条写明了。
多少钱? 本体免费:完整的实时转录,不限时间、不限次数。翻译和历史导出由一次性 DLC 解锁。首次使用起 有 7 天全功能试用。