DDeeptoai Learning

公开 AI 长课 · 正在连载

从下一个 Token 开始,看懂 Transformer。

模型为什么能一个字一个字写出回答?这门课沿着一次真实生成往里走:输入、词表、概率、训练、Attention、Transformer,最后到 GPT。

29 节已经开放边读边实验
D吐字之路:从输入到下一个 Token
从 C01 开始

你会经过

P0 · 开场:为何一个字一个字吐

C01 · 机器怎样读一句话,又怎样写出下一块?

P1 · 世界一:猜下一个字(表)

C04 · 词表是怎样造出来的?

P2 · 世界二:旋钮怎样自己学会拧

C09 · 固定表不够用:先造一台可调分数机

P3 · 世界三:看远处

C15 · Token ID 没有意义,Embedding 怎样学出位置

P4 · 世界四:Transformer 骨架

P5 · 世界五:自造小 GPT

P6 · 世界六:训得像回事

P7 · 世界七:从小 GPT 到当代助手

第一站

C01 · 机器怎样读一句话,又怎样写出下一块?

文字切分 → Token ID → 下一 Token 分布 → 自回归循环 → 训练损失

这一节要回答

机器怎样读一句话,又怎样写出下一块?

打开这一节

怎么学

先看见问题,再一路往里走。

01

从你关心的地方进

可以顺着 C01 往后读,也可以先打开 Transformer、Attention 或代码,再沿链接补回前面的桥。

zh
02

遇到机制,就动手试

Playground 用真实的缩小模型、真实权重和真实中间结果。看见数字怎样跟着操作变化。

zh
03

学到一半,知道自己在哪

每一部都有一个问题。读完一节,会知道它解决了什么,也知道下一节为什么出现。

zh

现在开始

先搞懂模型怎样读一句话。

进入 C01