Language
AI 實驗室 · 強化學習 · 可打分
調吃果/死亡/每步成本與學習參數,訓練蛇活得久、吃得多。
真正要優化的是整局吃了幾顆,不是「下一秒有沒有吃到」。 「馬上追果」常常把路堵死;「長遠總分」會在不安全時故意晚點吃,改走 S 形掃場。 過關看平均吃果 ≥ 12(Q 學習需先訓練)。
本局吃了 0 顆 · 步數 0
策略(比的是整局總分)
建議先選「長遠總分」按測平均分/看這一局,再對照「貪心追果」——同樣規則下,誰的整局總分高就對了。 Q 學習若獎勵太強調立刻吃果,會學成貪心,難學到長遠策略。