The Fine-Tuning Index / RLHF & Preference / #163
waltonfuture/MM-UPT
by waltonfuture · RLHF & Preference · updated 10mo ago
[NeurIPS 2025] First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
22
momentum
90
stars
2
forks
#163
rank
grpomllmunsupervised-learning
View on GitHub →