Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 9 days ago • 36 • 7
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 9 days ago • 36 • 7
A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules Paper • 2503.12811 • Published Mar 17, 2025 • 2
How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining Paper • 2511.18903 • Published Nov 24, 2025 • 2
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 9 days ago • 36
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 9 days ago • 36