user@devops:~$ cat README.md
Reinforcement Learning
# Descripción
Proyecto completo de Reinforcement Learning con tres enfoques fundamentales. Tabular Q-Learning en FrozenLake-v1 (grid 4x4, 16 estados, 4 acciones, piso resbaladizo, 5,000 episodios, tabla Q 16x4, evaluacion 15% exito). Deep Q-Network en CartPole-v1 (espacio de estados continuo 4D, red neuronal fully-connected 64-64, 300 episodios, Experience Replay buffer 50K, Target Network actualizada cada 20 episodios, recompensa promedio 130). Incluye visualizacion de curva de aprendizaje, politica optima del grid, mapa de calor de Q-valores, y comparativa boxplot Q-Learning vs DQN.
# Características principales
$ Tabular Q-Learning con tabla Q 16x4 para FrozenLake-v1
$ Deep Q-Network con red 64-64-2 para CartPole-v1 continuo 4D
$ Experience Replay con buffer de 50,000 experiencias
$ Target Network para estabilidad del entrenamiento DQN
$ Epsilon-greedy con decay progresivo (1.0 -> 0.01)
$ Evaluacion de politica aprendida (50 episodios, avg reward ~130)
$ 5 visualizaciones: curvas de aprendizaje, heatmaps, politica, boxplot
# Galería
# Tecnologías utilizadas