有个仓库是真够硬核,从零手搓一个GPT,不依赖任何高级库。Attention、多头机制、前馈网络、Embedding、残差连接、Layer Norm,怎么搭起来的全给你拆开看。而且不止模型本身,整条链路都有:
1️⃣ 数据下载、预处理、训练、生成一整套流程
2️⃣ 训练数据用The Pile,22个来源共825GB
3️⃣ tiktoken分词,存成HDF5格式
4️⃣ 预训练之后还顺带给了SFT和RLHF的路线
从这儿入门最干净:https://github.com/FareedKhan-dev/train-llm-from-scratch