AI 實驗室 · 理論概念
輸入文章:分詞 → 向量 → Self-Attention → Softmax,看下一個 token 怎麼來。
輸入一段文章,跟著步驟看分詞、向量、Self-Attention 的真實計算。最後的「生成」不是 ChatGPT 那種訓練好的語言模型,而是用你文章裡的 n-gram(哪個字常接哪個字)示範 Softmax 怎麼選下一個 token——所以續寫只會像在重組原文,不會寫出新知識。右側對照論文 Figure 1。
貼上一段文字,當模型要讀的文章。
Vaswani et al. · Fig. 1
Transformer 架構
Inputs / Outputs
論文圖底部:左邊進原文,右邊出續寫。
論文風格原圖(Commons)。切回「步驟對照」可看目前步驟對應哪一塊。