The Fine-Tuning Index / RLHF & Preference / #42
Sphere-AI-Lab/orbit
by Sphere-AI-Lab · RLHF & Preference · updated 1d ago
Stable and Efficient Reinforcement Learning for Trillion-Parameter LLMs
57
momentum
157
stars
9
forks
#42
rank
cudalow-precisionpeftreinforcement-learningtransformers
View on GitHub →