Simple-2048-RL
從遊戲狀態到策略,練習理解強化學習。
從什麼問題開始
DQN 強化學習訓練 AI 玩 2048。環境建置、神經網路、訓練 pipeline 全部從頭刻。想驗證強化學習在策略遊戲上到底能走多遠。
做了哪些事
- 實作 2048 環境、神經網路與訓練流程,使用 Pygame 呈現棋盤。
- 以 log2 編碼、epsilon-greedy、MSE 與 Adam 理解訓練的各個環節。
資料怎麼走
- 16 維狀態
- 4 種動作
- 獎勵回饋
- Replay buffer
- DQN 更新
從遊戲狀態到策略,練習理解強化學習。
DQN 強化學習訓練 AI 玩 2048。環境建置、神經網路、訓練 pipeline 全部從頭刻。想驗證強化學習在策略遊戲上到底能走多遠。