user@devops:~$ cat README.md
Whisper STT
# Descrição
Projeto de reconhecimento de fala com OpenAI Whisper, um modelo encoder-decoder transformer treinado em 680.000 horas de dados multilíngues. O pipeline gera audio real com gTTS em espanhol, ingles e bilíngue, e transcreve com os modelos tiny (37M params, ~142MB) e base (72M params, ~274MB). Inclui comparacao detalhada de WER (Word Error Rate), CER (Character Error Rate), RTF (Real-Time Factor), deteccao automatica de idioma (99.9% de precisao para espanhol e ingles), word-level timestamps com confianca por palavra e exportacao para formatos SRT, VTT, TSV e JSON. O modelo base atinge 0% WER em ingles e 7.4% em espanhol com audio claro.
# Características principais
$ Transcricao multilíngue com OpenAI Whisper (tiny + base, 37M–72M parametros)
$ Word Error Rate (WER) e Character Error Rate (CER) como metricas de precisao
$ Deteccao automatica de idioma com 99.9% de precisao (espanhol, ingles)
$ Word-level timestamps com confianca por palavra para alinhamento exato
$ Exportacao para formatos profissionais: SRT, VTT, TSV, JSON
$ 6 visualizacoes: forma de onda, comparacao de modelos, timeline, matriz de idioma
$ Audio real sintetizado com gTTS (Google Text-to-Speech) em 3 idiomas
# Galeria
# Tecnologias utilizadas