arxiv:2610.00574
Zhan Cheng
zcheng256
ยท
AI & ML interests
None yet
Recent Activity
updated a model about 1 hour ago
zcheng256/OPSD-SDPO-v22-Qwen2.5-7B-checkpoints published a model about 1 hour ago
zcheng256/OPSD-SDPO-v22-Qwen2.5-7B-checkpoints authored a paper 9 days ago
Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RLOrganizations
None yet