すべてのツール

使い方

字幕は 3 つのステップで生成され、処理はすべてデバイス上で行われます。

字幕を生成
  1. 01ファイルを選択一般的な形式の動画または音声を選択します。ファイルはこのデバイス上で読み込まれ、アップロードされません。
  2. 02生成Whisper が音声を文字に起こします。モデルのダウンロードは初回のみで、以降はブラウザに保存されます。
  3. 03編集と書き出しテキストを修正し、SRT、VTT、プレーンテキスト、または字幕入りの動画をダウンロードします。

よくある質問

プライバシー、精度、動作環境について。

ファイルはアップロードされますか?

いいえ。音声のデコード、音声認識、動画の書き出しはすべてブラウザ内で行われます。ダウンロードされるのは、Hugging Face から取得する音声モデルのみです。

どのモデルを選べばよいですか?

「高精度」は Whisper large-v3-turbo(約 620 MB)を使用し、WebGPU が必要です。「高速」は Whisper base(約 110 MB)を使用し、より多くのデバイスで動作しますが、特に英語以外の言語では誤りが多くなります。

どのくらい時間がかかりますか?

WebGPU に対応した最近のノート PC では、1 時間の音声の処理に「高精度」で約 15 分、「高速」で約 5 分かかります。無音部分はスキップされます。

どの言語に対応していますか?

日本語、英語、中国語、スペイン語、ポルトガル語、ドイツ語など、30 を超える言語に対応しています。自動検出よりも、言語を指定したほうが精度が高くなります。

字幕を動画に焼き込めますか?

はい。焼き込むと字幕が映像内に描画され、元の音声を残したまま MP4 として書き出されます。文字サイズとスタイルはプレビューの表示どおりになります。

オフラインで使用できますか?

はい。ページとモデルを一度読み込めば使用できます。モデルはサイトデータを削除するまでブラウザに保存されます。

どのブラウザに対応していますか?

Chrome、Edge、Safari、Firefox の最新版に対応しています。「高精度」モデルには WebGPU が必要です。WebGPU は多くの PC の Chrome と Edge で利用できます。