PSFT+RL models
SII-Wenhong
wh-zhu
AI & ML interests
None yet
Organizations
models 57
wh-zhu/qwen2_7B-ultrachatfeedback-wspo
8B • Updated • 3
wh-zhu/Qwen2.5-7B-PSFT-RL-DAPO-90
Text Generation • 8B • Updated • 16
wh-zhu/qwen2.5-1.5B-longcot-reasoning-HPD
Text Generation • 2B • Updated • 18
wh-zhu/Qwen2.5-7B-Instruct-SFT-lr-5e6
8B • Updated • 2
wh-zhu/Qwen2.5-7B-Instruct-16-1300
8B • Updated • 6
wh-zhu/Qwen2.5-7B-Instruct-ref-1300
8B • Updated • 7
wh-zhu/Qwen2.5-7B-Instruct-update4-600
8B • Updated • 5
wh-zhu/Qwen2.5-7B-Instruct-VL-SFT-RL120
8B • Updated • 10
wh-zhu/Qwen2.5-7B-Instruct-VL-SFT-RL165
8B • Updated • 7
wh-zhu/Qwen2.5-7B-Instruct-VL-PSFT-RL165
8B • Updated • 10
datasets 6
wh-zhu/dapo
Viewer • Updated • 17.4k • 12
wh-zhu/train_openr1_8k
Viewer • Updated • 45.8k • 30
wh-zhu/aime-24
Viewer • Updated • 960 • 11
wh-zhu/train_openr1_4k
Viewer • Updated • 25.4k • 28 • 2
wh-zhu/short_cot_calibration
Viewer • Updated • 52.8k • 13
wh-zhu/long_cot_calibration
Viewer • Updated • 35k • 30