Como funciona
As legendas são geradas em três etapas, tudo no seu dispositivo.
- 01Escolher arquivoVídeo ou áudio em formatos comuns. O arquivo é lido neste dispositivo e não é enviado.
- 02GerarO Whisper transcreve a fala. O modelo é baixado uma única vez e fica salvo no navegador.
- 03Editar e exportarCorrija o texto e baixe as legendas em SRT, VTT ou texto simples, ou uma cópia legendada do vídeo.
Perguntas frequentes
Privacidade, precisão e requisitos.
O arquivo é enviado para algum servidor?
Não. A decodificação do áudio, o reconhecimento de fala e a exportação do vídeo são feitos no navegador. O único download é o do modelo de fala, obtido do Hugging Face.
Qual modelo escolher?
O modelo “Preciso” usa o Whisper large-v3-turbo (cerca de 620 MB) e requer WebGPU. O “Rápido” usa o Whisper base (cerca de 110 MB), funciona em mais dispositivos e comete mais erros, principalmente em idiomas que não o inglês.
Quanto tempo leva?
Em um notebook recente com WebGPU, uma hora de fala leva cerca de 15 minutos com o modelo “Preciso” e 5 com o “Rápido”. Os trechos em silêncio são ignorados.
Quais idiomas são reconhecidos?
Mais de 30, incluindo português, inglês, espanhol, chinês, japonês e alemão. Selecionar o idioma produz resultados melhores do que a detecção automática.
As legendas podem ser embutidas no vídeo?
Sim. Ao embuti-las, o texto passa a fazer parte da imagem e o vídeo é exportado em MP4 com o áudio original. A prévia mostra o tamanho e o estilo aplicados.
Funciona offline?
Sim, depois que a página e o modelo são carregados. O modelo fica salvo no navegador até que os dados do site sejam limpos.
Quais navegadores são compatíveis?
As versões atuais do Chrome, do Edge, do Safari e do Firefox. O modelo “Preciso” requer WebGPU, disponível no Chrome e no Edge na maioria dos computadores.