user@devops:~$ cat README.md
ML Production Pipeline
# Descripción
ML Production Pipeline es una simulación completa de un sistema de Machine Learning en producción. Cubre la validación de datos con controles de calidad, ingeniería de características personalizada (segmentos de antigüedad, ratios de cargos, interacciones de servicios), entrenamiento con 3 algoritmos (LogisticRegression, RandomForest, GradientBoosting) usando validación cruzada estratificada 5-fold, registro de modelos con MLflow, inferencia por lotes en 5 lotes de producción con drift simulado, y monitoreo continuo usando PSI (Population Stability Index) con seguimiento de precisión/AUC. Incluye 8 visualizaciones que cubren la arquitectura completa del pipeline, comparación de modelos, curvas ROC, matriz de confusión, importancia de características y paneles de monitoreo.
# Características principales
$ Validación de datos e informes de calidad con detección de valores faltantes
$ Pipeline de ingeniería de características con segmentación de antigüedad, ratios de cargos e interacciones entre servicios
$ ColumnTransformer de scikit-learn para preprocesamiento mixto numérico/categórico/binario
$ Pipeline de entrenamiento con 3 modelos (LR, RF, GB) y validación cruzada 5-fold
$ MLflow para tracking de experimentos con registro de modelos y ejecuciones anidadas
$ Pipeline de inferencia por lotes en 5 lotes de producción con persistencia de modelos versionados
$ Detección de drift con Population Stability Index (PSI) para monitorear cambios en distribución de scores
$ Panel de monitoreo en tiempo real con tendencias de precisión/AUC y umbrales de alerta PSI
# Galería
# Tecnologías utilizadas