Base Models Can Reason By Taking a Cue From Training Data Paper • 2610.06851 • Published 7 days ago • 25
GTR: Gated Token Recurrence for Efficient Dense Prediction Paper • 2609.26590 • Published 19 days ago • 16
Smaller Models, Better Rejects: Preference Distillation Scaling Paper • 2609.38987 • Published 12 days ago • 31
Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents Paper • 2609.17653 • Published 27 days ago • 45
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression Paper • 2609.19969 • Published 25 days ago • 228
Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training Paper • 2609.07108 • Published Sep 7 • 36