The Fine-Tuning Index / RLHF & Preference / #99
tanzelin430/The-Scaling-Law-for-Reinforcement-Learning
by tanzelin430 · RLHF & Preference · updated 2mo ago
[ACL2026 MainConference]Code Repo for paper "Scaling Behaviors of LLM Reinforcement Learning Post-Training"
35
momentum
26
stars
4
forks
#99
rank