Cómo funciona

Los subtítulos se generan en tres pasos, todo en tu dispositivo.

Generar subtítulos
  1. 01Elegir archivoVideo o audio en un formato común. Se lee en este dispositivo y no se sube.
  2. 02GenerarWhisper transcribe la voz. El modelo se descarga una sola vez y permanece en el navegador.
  3. 03Editar y exportarCorrige el texto y descarga el archivo SRT, VTT o de texto sin formato, o una copia del video con los subtítulos.

Preguntas frecuentes

Privacidad, precisión y requisitos.

¿Se sube mi archivo?

No. La decodificación del audio, el reconocimiento de voz y la exportación del video se realizan en tu navegador. Lo único que se descarga es el modelo de reconocimiento de voz, desde Hugging Face.

¿Qué modelo debo elegir?

El modelo Preciso usa Whisper large-v3-turbo (unos 620 MB) y requiere WebGPU. El modelo Rápido usa Whisper base (unos 110 MB), funciona en más dispositivos y comete más errores, sobre todo en idiomas distintos del inglés.

¿Cuánto tarda?

En un equipo portátil reciente con WebGPU, transcribir una hora de voz lleva unos 15 minutos con el modelo Preciso y unos 5 con el Rápido. Los silencios se omiten.

¿Qué idiomas son compatibles?

Más de 30, entre ellos español, inglés, chino, japonés, portugués y alemán. Indicar el idioma ofrece mejores resultados que la detección automática.

¿Se pueden añadir los subtítulos al video?

Sí. Al incrustarlos, el texto se dibuja en la imagen y se exporta un MP4 con el audio original. La vista previa muestra el tamaño y el estilo que se usarán.

¿Funciona sin conexión?

Sí, una vez cargados la página y el modelo. El modelo permanece en el navegador hasta que se borran los datos del sitio.

¿Qué navegadores son compatibles?

Las versiones actuales de Chrome, Edge, Safari y Firefox. El modelo Preciso requiere WebGPU, disponible en Chrome y Edge en la mayoría de los equipos.