The Fine-Tuning Index / RLHF & Preference / #42

Sphere-AI-Lab/orbit

by Sphere-AI-Lab · RLHF & Preference · updated 1d ago

Stable and Efficient Reinforcement Learning for Trillion-Parameter LLMs

57
momentum
157
stars
9
forks
#42
rank
cudalow-precisionpeftreinforcement-learningtransformers
View on GitHub →