使い方
字幕は 3 つのステップで生成され、処理はすべてデバイス上で行われます。
- 01ファイルを選択一般的な形式の動画または音声を選択します。ファイルはこのデバイス上で読み込まれ、アップロードされません。
- 02生成Whisper が音声を文字に起こします。モデルのダウンロードは初回のみで、以降はブラウザに保存されます。
- 03編集と書き出しテキストを修正し、SRT、VTT、プレーンテキスト、または字幕入りの動画をダウンロードします。
よくある質問
プライバシー、精度、動作環境について。
ファイルはアップロードされますか?
いいえ。音声のデコード、音声認識、動画の書き出しはすべてブラウザ内で行われます。ダウンロードされるのは、Hugging Face から取得する音声モデルのみです。
どのモデルを選べばよいですか?
「高精度」は Whisper large-v3-turbo(約 620 MB)を使用し、WebGPU が必要です。「高速」は Whisper base(約 110 MB)を使用し、より多くのデバイスで動作しますが、特に英語以外の言語では誤りが多くなります。
どのくらい時間がかかりますか?
WebGPU に対応した最近のノート PC では、1 時間の音声の処理に「高精度」で約 15 分、「高速」で約 5 分かかります。無音部分はスキップされます。
どの言語に対応していますか?
日本語、英語、中国語、スペイン語、ポルトガル語、ドイツ語など、30 を超える言語に対応しています。自動検出よりも、言語を指定したほうが精度が高くなります。
字幕を動画に焼き込めますか?
はい。焼き込むと字幕が映像内に描画され、元の音声を残したまま MP4 として書き出されます。文字サイズとスタイルはプレビューの表示どおりになります。
オフラインで使用できますか?
はい。ページとモデルを一度読み込めば使用できます。モデルはサイトデータを削除するまでブラウザに保存されます。
どのブラウザに対応していますか?
Chrome、Edge、Safari、Firefox の最新版に対応しています。「高精度」モデルには WebGPU が必要です。WebGPU は多くの PC の Chrome と Edge で利用できます。