使用说明
生成字幕分为三步,全程在本地完成。
- 01选择文件支持常见格式的视频和音频。文件在本地读取,不会上传。
- 02生成由 Whisper 识别语音。模型仅需下载一次,之后保存在浏览器中。
- 03校对与导出修改文字后,下载 SRT、VTT 或纯文本,或导出带字幕的视频。
常见问题
隐私、准确度与运行要求。
文件会上传吗?
不会。音频解码、语音识别和视频导出均在浏览器中完成,唯一的下载是来自 Hugging Face 的语音模型。
应该选择哪个模型?
“精准”使用 Whisper large-v3-turbo,约 620 MB,需要 WebGPU。“快速”使用 Whisper base,约 110 MB,适用设备更多,但错误较多,英语以外的语言尤为明显。
需要多长时间?
在支持 WebGPU 的新款笔记本电脑上,一小时的语音使用“精准”约需 15 分钟,使用“快速”约需 5 分钟。无人声的部分会自动跳过。
支持哪些语言?
支持 30 余种语言,包括中文、英语、日语、西班牙语、葡萄牙语和德语。手动指定语言比自动识别更准确。
可以把字幕压制进视频吗?
可以。字幕将绘制在画面中,导出为保留原音轨的 MP4。字号和样式以预览为准。
可以离线使用吗?
可以。页面和模型加载后即可离线使用。模型会一直保存在浏览器中,直到清除网站数据。
支持哪些浏览器?
支持最新版 Chrome、Edge、Safari 和 Firefox。“精准”模型需要 WebGPU,多数电脑上的 Chrome 和 Edge 均已支持。