Language
AI 實驗室 · 6 個實驗
格子世界、迷宮、拉霸、接球、井字棋——用獎勵訓練代理人。
格子世界找蘋果:手動試錯,或看 Q-learning 自己變聰明。
調學習率與探索率,訓練後測走出迷宮的成功率。
多臂老虎機:只調探索率 ε,拉 100 次看總獎金。
調接到/漏接/移動的獎勵,訓練板子學會接球。
調吃果/死亡/每步成本與學習參數,訓練蛇活得久、吃得多。
調獎勵讓 AI 自我對弈,再對隨機對手測勝率。