$ cd ../
Whisper STT — bash

user@devops:~$ cat README.md

Whisper STT

# Descrição

Projeto de reconhecimento de fala com OpenAI Whisper, um modelo encoder-decoder transformer treinado em 680.000 horas de dados multilíngues. O pipeline gera audio real com gTTS em espanhol, ingles e bilíngue, e transcreve com os modelos tiny (37M params, ~142MB) e base (72M params, ~274MB). Inclui comparacao detalhada de WER (Word Error Rate), CER (Character Error Rate), RTF (Real-Time Factor), deteccao automatica de idioma (99.9% de precisao para espanhol e ingles), word-level timestamps com confianca por palavra e exportacao para formatos SRT, VTT, TSV e JSON. O modelo base atinge 0% WER em ingles e 7.4% em espanhol com audio claro.

# Características principais

$ Transcricao multilíngue com OpenAI Whisper (tiny + base, 37M–72M parametros)

$ Word Error Rate (WER) e Character Error Rate (CER) como metricas de precisao

$ Deteccao automatica de idioma com 99.9% de precisao (espanhol, ingles)

$ Word-level timestamps com confianca por palavra para alinhamento exato

$ Exportacao para formatos profissionais: SRT, VTT, TSV, JSON

$ 6 visualizacoes: forma de onda, comparacao de modelos, timeline, matriz de idioma

$ Audio real sintetizado com gTTS (Google Text-to-Speech) em 3 idiomas

# Galeria

Vista desktop
Whisper STT - Vista desktop
Vista mobile
Whisper STT - Vista mobile

# Tecnologias utilizadas

Python PyTorch OpenAI Whisper gTTS matplotlib
Hermes Agent