The Fine-Tuning Index / RLHF & Preference / #99

tanzelin430/The-Scaling-Law-for-Reinforcement-Learning

by tanzelin430 · RLHF & Preference · updated 2mo ago

[ACL2026 MainConference]Code Repo for paper "Scaling Behaviors of LLM Reinforcement Learning Post-Training"

35
momentum
26
stars
4
forks
#99
rank
View on GitHub →