大模型训练流程实践
6.1 模型预训练
在上一章,我们逐步拆解了 LLM 的模型结构及训练过程,从零手写实现了 LLaMA 模型结构及 Pretrain、SFT 全流程,更深入地理解了 LLM 的模型原理及训练细节。但是,在实际应用中,手写实现的 LLM 训练存在以下问题:
- 手写实现 LLM 结构工作量大,难以实时跟进最新模型的结构创新;
- 从零实现的 LLM 训练无法较好地实现多卡分布式训练,训练效率较低;
- 和现有预训练 LLM 不兼容,无法使用预训练好的模型参数
因此,在本章中,我们将介绍目前 LLM 领域的主流训练框架 Transformers,并结合分布式框架 deepspeed、高效微调框架 peft 等主流框架,实践使用 transformers 进行模型 Pretrain、SFT 全流程,更好地对接业界的主流 LLM 技术方案。