从零搭建大语言模型并记录整个学习过程 1. 学习计划 分词器 PyTorch 与资源分配 语言模型架构与训练细节 混合专家模型 GPU 与相关优化 GPU 高性能编程 分布式训练 Scaling Laws 推理 数据工程 评估与基准测试 大模型训练流程 强化学习 多模态模型 拓展:LLM 推理 2. 参考资料 datawhalechina.github.io/diy-llm understanding-deep-learning-zh.vercel.app nano-ai.tech/articles datawhalechina.github.io/hello-gpu/part0-intro/chapter0