user@devops:~$ cat README.md
AutoML Comparativa
# Descripción
AutoML (Machine Learning Automatizado) comparado en la práctica: 5 estrategias compiten por encontrar el mejor clasificador para Breast Cancer Wisconsin (569 muestras, 30 features) sin intervención manual. Estrategias: (1) Baseline — RandomForest por defecto; (2) GridSearchCV — evalúa las 12 combinaciones de una rejilla; (3) RandomizedSearchCV — 30 muestras al azar de un espacio de 360 combinaciones; (4) Optuna TPE — 60 trials de optimización Bayesiana que además elige entre 4 algoritmos (RF, GradientBoosting, LogisticRegression, SVM); (5) TPOT — programación genética que evoluciona pipelines completos (scaler + selector + clasificador) con crossover y mutación. Resultados en test: Optuna TPE gana con ROC-AUC 0.9983 (acc 0.986, F1 0.989) en solo 18.7s de búsqueda; TPOT logra 0.9969 evolucionando pipelines no obvios (p. ej. LogisticRegression L1 con SelectPercentile); GridSearch (0.9952) y Baseline (0.9951) empatan en accuracy pero con 60x más esfuerzo manual. Hallazgos clave: (1) la búsqueda Bayesiana aprovecha trials previos y supera a la fuerza bruta con menos evaluaciones; (2) TPOT descubre pipelines que un humano no probaría; (3) la importancia de hiperparámetros de Optuna revela qué palancas mueven el score (C y gamma del SVM dominan); (4) el tiempo de búsqueda importa tanto como el score — GridSearch es 60x más lento que el baseline por la misma métrica. 7 visualizaciones: comparativa de métricas, eficiencia tiempo-vs-score, historial de Optuna, importancia de hiperparámetros, frente de Pareto de TPOT, matriz de confusión del ganador y top-12 features por permutation importance.
# Características principales
$ 5 estrategias AutoML comparadas: Baseline, GridSearchCV, RandomizedSearchCV, Optuna TPE y TPOT genético
$ Optuna gana: ROC-AUC 0.9983 con 60 trials de optimización Bayesiana en 18.7s
$ TPOT evoluciona pipelines completos (scaler + selector + clasificador) con programación genética
$ Optuna busca además entre 4 algoritmos: RandomForest, GradientBoosting, LogisticRegression y SVM
$ Análisis de eficiencia: score vs tiempo de búsqueda (GridSearch 60x más lento que baseline)
$ Importancia de hiperparámetros calculada con Optuna (C y gamma del SVM dominan)
$ Matriz de confusión y top-12 features del ganador vía permutation importance
$ Dataset real Breast Cancer Wisconsin con split estratificado y CV 5-fold
# Galería
# Tecnologías utilizadas