user@devops:~$ cat README.md
Whisper STT
# Descripción
Proyecto de reconocimiento de voz con OpenAI Whisper, un modelo encoder-decoder transformer entrenado en 680,000 horas de datos multilingüe. El pipeline genera audio real con gTTS en español, inglés y bilingüe, y transcribe con los modelos tiny (37M params, ~142MB) y base (72M params, ~274MB). Incluye comparación detallada de WER (Word Error Rate), CER (Character Error Rate), RTF (Real-Time Factor), detección automática de idioma (99.9% precisión para español e inglés), word-level timestamps con confianza por palabra, y exportación a formatos SRT, VTT, TSV y JSON. El modelo base alcanza 0% WER en inglés y 7.4% en español con audio claro.
# Características principales
$ Transcripción multilenguaje con OpenAI Whisper (tiny + base, 37M–72M parámetros)
$ Word Error Rate (WER) y Character Error Rate (CER) como métricas de precisión
$ Detección automática de idioma con 99.9% de precisión (español, inglés)
$ Word-level timestamps con confianza por palabra para alineación exacta
$ Exportación a formatos profesionales: SRT, VTT, TSV, JSON
$ 6 visualizaciones: forma de onda, comparación de modelos, segmentos timeline, matriz de idioma
$ Audio real sintetizado con gTTS (Google Text-to-Speech) en 3 idiomas
# Galería
# Tecnologías utilizadas