The Fine-Tuning Index / RLHF & Preference / #27

mbzuai-oryx/Awesome-LLM-Post-training

by mbzuai-oryx · RLHF & Preference · updated 6d ago

Awesome Reasoning LLM Tutorial/Survey/Guide

69
momentum
2,546
stars
170
forks
#27
rank
finelarge-language-modelspost-trainingreasoningreinforcement-learningscaling
View on GitHub →