Como funciona

As legendas são geradas em três etapas, tudo no seu dispositivo.

Gerar legendas
  1. 01Escolher arquivoVídeo ou áudio em formatos comuns. O arquivo é lido neste dispositivo e não é enviado.
  2. 02GerarO Whisper transcreve a fala. O modelo é baixado uma única vez e fica salvo no navegador.
  3. 03Editar e exportarCorrija o texto e baixe as legendas em SRT, VTT ou texto simples, ou uma cópia legendada do vídeo.

Perguntas frequentes

Privacidade, precisão e requisitos.

O arquivo é enviado para algum servidor?

Não. A decodificação do áudio, o reconhecimento de fala e a exportação do vídeo são feitos no navegador. O único download é o do modelo de fala, obtido do Hugging Face.

Qual modelo escolher?

O modelo “Preciso” usa o Whisper large-v3-turbo (cerca de 620 MB) e requer WebGPU. O “Rápido” usa o Whisper base (cerca de 110 MB), funciona em mais dispositivos e comete mais erros, principalmente em idiomas que não o inglês.

Quanto tempo leva?

Em um notebook recente com WebGPU, uma hora de fala leva cerca de 15 minutos com o modelo “Preciso” e 5 com o “Rápido”. Os trechos em silêncio são ignorados.

Quais idiomas são reconhecidos?

Mais de 30, incluindo português, inglês, espanhol, chinês, japonês e alemão. Selecionar o idioma produz resultados melhores do que a detecção automática.

As legendas podem ser embutidas no vídeo?

Sim. Ao embuti-las, o texto passa a fazer parte da imagem e o vídeo é exportado em MP4 com o áudio original. A prévia mostra o tamanho e o estilo aplicados.

Funciona offline?

Sim, depois que a página e o modelo são carregados. O modelo fica salvo no navegador até que os dados do site sejam limpos.

Quais navegadores são compatíveis?

As versões atuais do Chrome, do Edge, do Safari e do Firefox. O modelo “Preciso” requer WebGPU, disponível no Chrome e no Edge na maioria dos computadores.