The Fine-Tuning Index / RLHF & Preference / #51
Enping-Hu/minimind-deep-dive
by Enping-Hu · RLHF & Preference · updated 1mo ago
从 MiniMind 源码读起,再延伸到现代大模型技术体系的中文学习笔记。主线逐行精读预训练 / SFT / DPO / PPO / GRPO 与训练机制;附录 17 篇进阶卷覆盖量化、投机解码、RLHF 全景、模型代际史等 MiniMind 没涉及、但进阶绕不开的主题。
53
momentum
219
stars
12
forks
#51
rank
deep-learningdpofine-tuningfrom-scratchgrpolarge-language-modelsllmllm-trainingminimindmoenlpppo
View on GitHub →