陳胤辰中原商設
首頁
上學期・AI
課程總覽預測世界AI 歷史AI 實驗室自主學習
下學期・程式
課程總覽JS 基礎教學JavaSciptP5.js (上課用)運算思維與程式設計互動遊戲
延伸探索
人體系統玄學系統建築系統原民織布
簡介
講師介紹開課資訊

語言

繁體中文简体中文English日文Bahasa Indonesia

陳胤辰

中原大學商業設計系
資宸科技

快速連結

  • 講師介紹
  • 開課資訊
  • 互動遊戲
  • JavaScipt

聯絡 & 社群

© 2026 陳胤辰。版權所有。

Built with Next.js & Tailwind CSS

🧪 總覽📜 AI 歷史📖 理論概念💻 上機實驗🎯 強化學習

AI 實驗室 · 強化學習 · 可打分

貪食蛇

調吃果/死亡/每步成本與學習參數,訓練蛇活得久、吃得多。

目標:整局總分最高

真正要優化的是整局吃了幾顆,不是「下一秒有沒有吃到」。 「馬上追果」常常把路堵死;「長遠總分」會在不安全時故意晚點吃,改走 S 形掃場。 過關看平均吃果 ≥ 12(Q 學習需先訓練)。

●
🍎

本局吃了 0 顆 · 步數 0

訓練後會顯示:橫軸=訓練局數,縱軸=平均吃果數

策略(比的是整局總分)

建議先選「長遠總分」按測平均分/看這一局,再對照「貪心追果」——同樣規則下,誰的整局總分高就對了。 Q 學習若獎勵太強調立刻吃果,會學成貪心,難學到長遠策略。