⚑ At a Glance

Model Params Final Avg Highlights
WhirlwindAI/MetaNova-Test 70.55M 31.94% πŸ… ARC-Challenge (25.09%)
WhirlwindAI/MetaNova-0.1-70M 70.55M 35.36% πŸ… ArithMark-2 (27.12%)
SupraLabs/Supra-50M-Base 51.79M 38.60% πŸ… HellaSwag, ARC-Easy, PIQA, ARC Avg, Final Avg

🟣 Quick summary β€” The WhirlwindAI MetaNova models each have their own strengths: MetaNova-0.1-70M leads on ArithMark-2, while MetaNova-Test takes ARC-Challenge. Supra-50M-Base (external baseline) posts the highest Final Avg at 38.60% with the smallest parameter count.


🏁 Full Leaderboard

Benchmark WhirlwindAI/
MetaNova-Test
WhirlwindAI/
MetaNova-0.1-BF16
SupraLabs/
Supra-50M-Base
Params 70.55M 70.55M 51.79M
HellaSwag 25.37% 27.40% 31.65%
ARC-Easy 26.89% 31.73% 45.58%
ARC-Challenge 25.09% 25.00% 24.66%
PIQA 52.29% 58.54% 61.53%
ArithMark-2 24.12% 27.12% 26.08%
ARC Avg 25.99% 28.37% 35.12%
Final Avg 31.94% 35.36% 38.60% πŸ†

πŸ† = best score in the row. Bold = row winner.


πŸ“Š Metric-by-Metric View

🟣 HellaSwag
Model Score
MetaNova-Test 25.37% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
MetaNova-0.1-BF16 27.40% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
Supra-50M-Base 31.65% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘
🟣 ARC-Easy
Model Score
MetaNova-Test 26.89% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
MetaNova-0.1-BF16 31.73% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘
Supra-50M-Base 45.58% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘
🟣 ARC-Challenge
Model Score
MetaNova-Test 25.09% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
MetaNova-0.1-BF16 25.00% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
Supra-50M-Base 24.66% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
🟣 PIQA
Model Score
MetaNova-Test 52.29% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘
MetaNova-0.1-BF16 58.54% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
Supra-50M-Base 61.53% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
🟣 ArithMark-2
Model Score
MetaNova-Test 24.12% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
MetaNova-0.1-BF16 27.12% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
Supra-50M-Base 26.08% β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘β–‘
🟣 Averages
Metric MetaNova-Test MetaNova-0.1-BF16 Supra-50M-Base
ARC Avg 25.99% 28.37% 35.12%
Final Avg 31.94% 35.36% 38.60%

🧠 THINKING Chat Format

Thinking Mode Non-Thinking Mode
<|im_start|>user
{query} /think<|im_end|>
<|im_start|>assistant
<think>
{thinking_content}
</think>

{response}<|im_end|>

<|im_start|>user
{query} /no_think<|im_end|>
<|im_start|>assistant
<think>

</think>

{response}<|im_end|>
  </td>
</tr>

πŸ”΅ blue = user / assistant content  β€’  πŸ”΄ red = mode switch + reasoning block


🧾 Run Summary

Model WhirlwindAI/MetaNova-0.1-70M
Model size 70.5M params
Tensor type BF16
Downloads last month 16
Models compared 3
Benchmarks HellaSwag Β· ARC-Easy Β· ARC-Challenge Β· PIQA Β· ArithMark-2 Β· ARC Avg Β· Final Avg
Parameter range 51.79M – 70.55M
Final Avg range 31.94% – 38.60%
Top Final Avg SupraLabs/Supra-50M-Base β€” 38.60%

⭐ If this model helped you, consider leaving a like on the Hub.



WhirlwindAI Β· 2026

Downloads last month
243
Safetensors
Model size
70.5M params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support