从你关心的地方进
可以顺着 C01 往后读,也可以先打开 Transformer、Attention 或代码,再沿链接补回前面的桥。
zh公开 AI 长课 · 正在连载
模型为什么能一个字一个字写出回答?这门课沿着一次真实生成往里走:输入、词表、概率、训练、Attention、Transformer,最后到 GPT。
你会经过
P0 · 开场:为何一个字一个字吐
C01 · 机器怎样读一句话,又怎样写出下一块?
P1 · 世界一:猜下一个字(表)
C04 · 词表是怎样造出来的?
P2 · 世界二:旋钮怎样自己学会拧
C09 · 固定表不够用:先造一台可调分数机
P3 · 世界三:看远处
C15 · Token ID 没有意义,Embedding 怎样学出位置
P4 · 世界四:Transformer 骨架
P5 · 世界五:自造小 GPT
P6 · 世界六:训得像回事
P7 · 世界七:从小 GPT 到当代助手
第一站
文字切分 → Token ID → 下一 Token 分布 → 自回归循环 → 训练损失
这一节要回答
机器怎样读一句话,又怎样写出下一块?
课程地图
沿一次真实生成逐层拆开 Token、概率、训练、RNN、Attention 与 Transformer。
8
课程阶段
41
全部课节
29
已经可以学习
12
仍在制作
正确问题 + 路线 + 数字直觉
从这里进入先造一台像极简输入法联想的透明语言模型,再看清 GPT 升级了哪里
从这里进入从可调分数到损失、梯度与神经网络猜字
从这里进入词向量、RNN、翻译瓶颈与 Attention 的诞生
从这里进入自注意力、掩码、完整积木与出词闭环
从这里进入训练、checkpoint、Model Pack
从这里进入数据、BPE、中文链路
从这里进入规模化预训练、后训练、上下文学习与模型适配
从这里进入怎么学
可以顺着 C01 往后读,也可以先打开 Transformer、Attention 或代码,再沿链接补回前面的桥。
zhPlayground 用真实的缩小模型、真实权重和真实中间结果。看见数字怎样跟着操作变化。
zh每一部都有一个问题。读完一节,会知道它解决了什么,也知道下一节为什么出现。
zh现在开始