The Fine-Tuning Index / RLHF & Preference / #27
mbzuai-oryx/Awesome-LLM-Post-training
by mbzuai-oryx · RLHF & Preference · updated 6d ago
Awesome Reasoning LLM Tutorial/Survey/Guide
69
momentum
2,546
stars
170
forks
#27
rank
finelarge-language-modelspost-trainingreasoningreinforcement-learningscaling
View on GitHub →