So funktioniert es
Untertitel entstehen in drei Schritten, vollständig auf Ihrem Gerät.
- 01Datei auswählenVideo oder Audio in einem gängigen Format. Die Datei wird auf diesem Gerät eingelesen, nicht hochgeladen.
- 02ErstellenWhisper wandelt das Gesprochene in Text um. Das Modell wird einmalig heruntergeladen und bleibt im Browser gespeichert.
- 03Bearbeiten und exportierenKorrigieren Sie den Text und laden Sie dann SRT, VTT, reinen Text oder eine Kopie des Videos mit Untertiteln herunter.
Häufige Fragen
Datenschutz, Genauigkeit und Voraussetzungen.
Wird meine Datei hochgeladen?
Nein. Audiodekodierung, Spracherkennung und Videoexport laufen vollständig in Ihrem Browser. Heruntergeladen wird nur das Sprachmodell von Hugging Face.
Welches Modell sollte ich wählen?
„Präzise“ verwendet Whisper large-v3-turbo (ca. 620 MB) und erfordert WebGPU. „Schnell“ verwendet Whisper base (ca. 110 MB), läuft auf mehr Geräten, macht aber mehr Fehler, vor allem in anderen Sprachen als Englisch.
Wie lange dauert es?
Auf einem aktuellen Laptop mit WebGPU benötigt „Präzise“ für eine Stunde Gesprochenes etwa 15 Minuten, „Schnell“ etwa 5. Stille Passagen werden übersprungen.
Welche Sprachen werden unterstützt?
Mehr als 30, darunter Deutsch, Englisch, Chinesisch, Japanisch, Spanisch und Portugiesisch. Wenn Sie die Sprache auswählen, sind die Ergebnisse besser als bei automatischer Erkennung.
Können die Untertitel ins Video eingefügt werden?
Ja. Beim Einbrennen wird der Text dauerhaft ins Bild übernommen und eine MP4-Datei mit dem Originalton exportiert. Größe und Stil entsprechen der Vorschau.
Funktioniert es offline?
Ja, sobald die Seite und das Modell geladen sind. Das Modell bleibt im Browser gespeichert, bis die Websitedaten gelöscht werden.
Welche Browser werden unterstützt?
Aktuelle Versionen von Chrome, Edge, Safari und Firefox. Das Modell „Präzise“ erfordert WebGPU, das in Chrome und Edge auf den meisten Computern verfügbar ist.