Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards Paper • 2610.02967 • Published 9 days ago • 29
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning Paper • 2609.35433 • Published 13 days ago • 12
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published about 1 month ago • 10
Self-Forcing++: Towards Minute-Scale High-Quality Video Generation Paper • 2510.02283 • Published Oct 2, 2025 • 98
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model Paper • 2503.05132 • Published Mar 7, 2025 • 57
Learning Video Representations without Natural Videos Paper • 2410.24213 • Published Oct 31, 2024 • 16
What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective Paper • 2410.23743 • Published Oct 31, 2024 • 64
DSBench: How Far Are Data Science Agents to Becoming Data Science Experts? Paper • 2409.07703 • Published Sep 12, 2024 • 66