Ⅰ · 1943–1969
1943–1956
關鍵轉折McCulloch 與 Pitts 先用數學描述「神經元如何計算」;1956 年 Dartmouth 研討會把這個領域正式命名為 Artificial Intelligence。一開始就有兩條路:一條模仿神經計算,一條追求符號與邏輯。
1950s–60s
人們相信「智慧 = 邏輯規則」。寫下 if-then,機器就能下棋、證明定理。短期成果令人興奮,但真實世界規則太多、太脆,一遇到模糊情境就崩——這條路後來會再以專家系統形式回來,也會再失敗一次。
1957–1969
Rosenblatt 的感知機用權重加總輸入,再決定「放電與否」。簡單、可學,在當時看起來像通往智慧的捷徑。但它只能畫直線邊界——下一節的限制分析,會直接打中這條路。
1969 → 第一次寒冬
關鍵轉折Minsky & Papert 系統性分析了單層感知機的限制,XOR 是最容易理解的代表例子。加上當時算力不足、訓練方法尚未成熟,以及早期承諾未能實現,神經網路研究逐漸失去資金與關注。後來才明白:多層 + 非線性激發,才能彎曲決策邊界——這正是「深度」的起點。
Ⅱ · 1980s–2000s
1980s → 1990s
企業開始把醫師、工程師與金融專家的判斷整理成大量 if-then 規則。短期內成果亮眼,但規則愈寫愈多、彼此衝突,維護成本暴增;面對沒看過的情況,系統也不會自己調整。AI 再次進入低潮,也讓研究者更重視「從資料學習」。
1986
關鍵轉折有了多層,還需要「怎麼調權重」。反向傳播用鏈式法則把誤差拆回每一條連線;梯度下降沿著損失山谷往下走。AI 從「人工寫規則」更明確地轉向「從資料學規則」——但當時資料與算力仍有限,還沒到深度學習爆發。
1990s–2000s
資料變多、算力變便宜。重點變成:選什麼特徵?訓練/測試怎麼切?怎樣避免背答案(過擬合)?SVM、隨機森林等方法也很強——實務流程往往比「炫技模型」更常決定成敗。
Ⅲ · 1997–2015
1997 → 2014
影像可以一次看完,但語言、聲音與時間序列必須按順序理解。RNN 的概念更早就已存在;1997 年提出的 LSTM,改善了普通 RNN 難以保留長期資訊的問題。不過,資料仍必須一步一步處理,訓練速度受到限制——這正是後面 Attention「為什麼必要」的鋪墊。
2012
關鍵轉折神經網路並不是突然被發明,而是三個條件終於同時成熟:大量標註資料(ImageNet)、GPU 平行運算,以及更容易訓練深層網路的方法(ReLU、Dropout 等)。AlexNet 在影像辨識比賽大幅領先,讓研究與產業重新押注神經網路。核心觀念:不是單一演算法突破,而是資料、算力、模型三者同時成熟。
延伸:2015 ResNet
ResNet 引入殘差連接(skip connection),讓資訊可以跨層直接傳遞,改善深層網路愈疊愈難訓練的問題。後來 Transformer 也大量使用這個設計——「深度」不只是一直加層。
2014–2015
早期翻譯模型必須把整個句子壓縮成固定長度的內部表示,句子愈長,資訊愈容易遺失。注意力機制讓模型在產生每個詞時,重新查看輸入內容,決定此刻應該注意哪些部分。對 AI 而言,Attention 不是「真正的注意力」,而是一種依照相關性動態分配權重的方法。
Attention 並不是 2017 Transformer 才出現;早期已用於機器翻譯。Query/Key/Value 是後來 Transformer 的標準表述。Google 團隊在 2017 年提出的是「完全以 Attention 為核心」的 Transformer。
Ⅳ · 2014–2016
2014–2022
分類模型回答「這是什麼」,生成模型則嘗試回答「新的內容可以長什麼樣」。GAN 讓生成器與判別器互相競爭;Diffusion 則學習如何從雜訊一步步還原出影像。這些方法推動了人臉、插畫、影像編輯與文字生成影像——商設學生最常接觸的,往往就是這條支線。
2021|CLIP:讓文字與影像進入同一個語意空間
模型同時學習圖片與文字描述的對應關係,使「一張圖片像哪一句話」可以被計算。這類圖文對齊技術後來成為文字生成影像、跨模態搜尋與多模態模型的重要基礎。
2015–2016
DQN 讓代理人直接觀看遊戲像素,透過分數獎勵學會行動。AlphaGo 進一步結合深度神經網路、樹搜尋與強化學習,擊敗頂尖圍棋棋手。重點不只是「AI 贏了人」,而是模型開始能在龐大的可能性中規劃與決策。
Ⅴ · 2017–2020
2017
關鍵轉折RNN 必須按照順序讀取文字,前面的結果算完,後面才能繼續。Transformer 使用 Self-Attention,讓句子中的每個位置直接衡量其他位置的重要性,因而更容易平行運算,也更能處理遠距離關係。它最初是為機器翻譯設計,後來卻成為語言、影像、聲音與多模態模型的共同基礎。
2018–2020
過去每個任務通常要各自蒐集資料、訓練模型。BERT、GPT 等模型改成先閱讀大量文字,學習語言中的結構與關係,再透過少量資料適應分類、問答、摘要或生成任務。AI 的開發方式從「每個問題訓練一個模型」,逐漸轉向「先訓練通用模型,再適應不同工作」。
2020–2022
當模型參數、訓練資料和計算量持續增加,大型語言模型在多項任務上的表現持續提升,並開始呈現少樣本學習、文字生成、程式撰寫等過去不明顯的能力,也開始能嘗試處理多步驟任務。使用者不一定要重新訓練模型,只要在提示中提供任務描述與範例,就能改變模型行為。
Ⅵ · 2020s → 現在
2020s → 現在
關鍵轉折指令微調與人類回饋讓模型更能理解使用者意圖,以對話方式完成任務。模型也逐步從只處理文字,擴展到影像、聲音、影片與工具操作。AI 不再只是單一預測模型,而開始成為能接收指令、使用工具與完成工作流程的系統。
RLHF 主要是調整模型行為,不等於模型因此獲得全部知識,也不能保證答案正確。
總結兩條線
Attention 是方法 → Transformer 是架構 → 預訓練是訓練方式 → LLM 是規模化結果 → ChatGPT 是產品與互動形式。
資料決定它看過什麼,損失函數決定它學什麼,架構決定它怎麼計算,對齊決定它如何回應人。
看完時間軸,直接進實驗室動手驗證直覺。
打開 AI 實驗室