$ cd ../
AutoML Comparativa — bash

user@devops:~$ cat README.md

AutoML Comparativa

# Descripción

AutoML (Machine Learning Automatizado) comparado en la práctica: 5 estrategias compiten por encontrar el mejor clasificador para Breast Cancer Wisconsin (569 muestras, 30 features) sin intervención manual. Estrategias: (1) Baseline — RandomForest por defecto; (2) GridSearchCV — evalúa las 12 combinaciones de una rejilla; (3) RandomizedSearchCV — 30 muestras al azar de un espacio de 360 combinaciones; (4) Optuna TPE — 60 trials de optimización Bayesiana que además elige entre 4 algoritmos (RF, GradientBoosting, LogisticRegression, SVM); (5) TPOT — programación genética que evoluciona pipelines completos (scaler + selector + clasificador) con crossover y mutación. Resultados en test: Optuna TPE gana con ROC-AUC 0.9983 (acc 0.986, F1 0.989) en solo 18.7s de búsqueda; TPOT logra 0.9969 evolucionando pipelines no obvios (p. ej. LogisticRegression L1 con SelectPercentile); GridSearch (0.9952) y Baseline (0.9951) empatan en accuracy pero con 60x más esfuerzo manual. Hallazgos clave: (1) la búsqueda Bayesiana aprovecha trials previos y supera a la fuerza bruta con menos evaluaciones; (2) TPOT descubre pipelines que un humano no probaría; (3) la importancia de hiperparámetros de Optuna revela qué palancas mueven el score (C y gamma del SVM dominan); (4) el tiempo de búsqueda importa tanto como el score — GridSearch es 60x más lento que el baseline por la misma métrica. 7 visualizaciones: comparativa de métricas, eficiencia tiempo-vs-score, historial de Optuna, importancia de hiperparámetros, frente de Pareto de TPOT, matriz de confusión del ganador y top-12 features por permutation importance.

# Características principales

$ 5 estrategias AutoML comparadas: Baseline, GridSearchCV, RandomizedSearchCV, Optuna TPE y TPOT genético

$ Optuna gana: ROC-AUC 0.9983 con 60 trials de optimización Bayesiana en 18.7s

$ TPOT evoluciona pipelines completos (scaler + selector + clasificador) con programación genética

$ Optuna busca además entre 4 algoritmos: RandomForest, GradientBoosting, LogisticRegression y SVM

$ Análisis de eficiencia: score vs tiempo de búsqueda (GridSearch 60x más lento que baseline)

$ Importancia de hiperparámetros calculada con Optuna (C y gamma del SVM dominan)

$ Matriz de confusión y top-12 features del ganador vía permutation importance

$ Dataset real Breast Cancer Wisconsin con split estratificado y CV 5-fold

# Galería

Terminal de la comparativa
AutoML Comparativa - Terminal de la comparativa
Métricas por estrategia
AutoML Comparativa - Métricas por estrategia
Historial de optimización Optuna
AutoML Comparativa - Historial de optimización Optuna
Pipelines TPOT y frente de Pareto
AutoML Comparativa - Pipelines TPOT y frente de Pareto
Eficiencia: score vs tiempo
AutoML Comparativa - Eficiencia: score vs tiempo

# Tecnologías utilizadas

Optuna scikit-learn TPOT Python NumPy Pandas