Language
AI 實驗室 · 理論概念
一邊學會、一邊驗收——為什麼不能用同一批資料打分數。
訓練集用來「學會」,測試集用來「驗收」——兩者不能混用。調整訓練比例,看兩邊統計差多少; 測試集太小,分數會很不穩定。
訓練集平均 y
0.491
測試集平均 y
0.591
兩邊差距
0.099
為什麼要分開?
如果用同一批資料又訓練又打分,就像考試前先看過答案——分數會虛高。 測試集模擬「沒看過的新資料」,才能知道模型有沒有真正學會。