user@devops:~$ cat README.md
Reinforcement Learning
# Descrição
Projeto completo de Reinforcement Learning com tres abordagens fundamentais. Tabular Q-Learning no FrozenLake-v1 (grade 4x4, 16 estados, 4 acoes, piso escorregadio, 5.000 episodios, tabela Q 16x4, avaliacao 15% sucesso). Deep Q-Network no CartPole-v1 (espaco de estado continuo 4D, rede neural fully-connected 64-64, 300 episodios, Experience Replay buffer 50K, Target Network atualizada a cada 20 episodios, recompensa media 130). Inclui curvas de aprendizado, visualizacao da politica otima do grid, mapa de calor de Q-valores, e comparativo boxplot Q-Learning vs DQN.
# Características principais
$ Tabular Q-Learning com tabela Q 16x4 para FrozenLake-v1
$ Deep Q-Network com rede 64-64-2 para CartPole-v1 continuo 4D
$ Experience Replay com buffer de 50.000 experiencias
$ Target Network para estabilidade do treinamento DQN
$ Epsilon-greedy com decaimento progressivo (1.0 -> 0.01)
$ Avaliacao de politica aprendida (50 episodios, avg reward ~130)
$ 5 visualizacoes: curvas de aprendizado, heatmaps, politica, boxplot
# Galeria
# Tecnologias utilizadas