The Fine-Tuning Index / RLHF & Preference / #45
FRS2003/hands-on-llm
by FRS2003 · RLHF & Preference · updated 2d ago
动手学大模型全栈:CS336 中文精讲 · PyTorch 手搓 Transformer · 单卡复现 Pretrain/SFT/LoRA/DPO/GRPO/RLVR · PEFT/Agent/RAG 落地(含真实实验、曲线与复现脚本)
58
momentum
109
stars
11
forks
#45
rank
cs336deep-learningdpofrom-scratchgrpohands-onlarge-language-modelsllama-factoryllmllm-agentlorapeft
View on GitHub →