The Fine-Tuning Index / RLHF & Preference / #163

waltonfuture/MM-UPT

by waltonfuture · RLHF & Preference · updated 10mo ago

[NeurIPS 2025] First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training

22
momentum
90
stars
2
forks
#163
rank
grpomllmunsupervised-learning
View on GitHub →