使用说明

生成字幕分为三步,全程在本地完成。

生成字幕
  1. 01选择文件支持常见格式的视频和音频。文件在本地读取,不会上传。
  2. 02生成由 Whisper 识别语音。模型仅需下载一次,之后保存在浏览器中。
  3. 03校对与导出修改文字后,下载 SRT、VTT 或纯文本,或导出带字幕的视频。

常见问题

隐私、准确度与运行要求。

文件会上传吗?

不会。音频解码、语音识别和视频导出均在浏览器中完成,唯一的下载是来自 Hugging Face 的语音模型。

应该选择哪个模型?

“精准”使用 Whisper large-v3-turbo,约 620 MB,需要 WebGPU。“快速”使用 Whisper base,约 110 MB,适用设备更多,但错误较多,英语以外的语言尤为明显。

需要多长时间?

在支持 WebGPU 的新款笔记本电脑上,一小时的语音使用“精准”约需 15 分钟,使用“快速”约需 5 分钟。无人声的部分会自动跳过。

支持哪些语言?

支持 30 余种语言,包括中文、英语、日语、西班牙语、葡萄牙语和德语。手动指定语言比自动识别更准确。

可以把字幕压制进视频吗?

可以。字幕将绘制在画面中,导出为保留原音轨的 MP4。字号和样式以预览为准。

可以离线使用吗?

可以。页面和模型加载后即可离线使用。模型会一直保存在浏览器中,直到清除网站数据。

支持哪些浏览器?

支持最新版 Chrome、Edge、Safari 和 Firefox。“精准”模型需要 WebGPU,多数电脑上的 Chrome 和 Edge 均已支持。