The Fine-Tuning Index / RLHF & Preference / #45

FRS2003/hands-on-llm

by FRS2003 · RLHF & Preference · updated 2d ago

动手学大模型全栈:CS336 中文精讲 · PyTorch 手搓 Transformer · 单卡复现 Pretrain/SFT/LoRA/DPO/GRPO/RLVR · PEFT/Agent/RAG 落地(含真实实验、曲线与复现脚本)

58
momentum
109
stars
11
forks
#45
rank
cs336deep-learningdpofrom-scratchgrpohands-onlarge-language-modelsllama-factoryllmllm-agentlorapeft
View on GitHub →