نیویگیشن
AI BENCHY
Advertise here

Mercury 2.5 Preview (low) vs Qwen3.5-9B

Qwen3.5-9B average score میں آگے ہے: 5.1 vs 5.0. Mercury 2.5 Preview (low) کی benchmark لاگت کم ہے: $0.011 vs $0.021. Mercury 2.5 Preview (low) تیز ہے: 1.31s vs 19.19s، pass rates 47.0% vs 19.7%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-02

درجہ
#254
کل آؤٹ پٹ ٹوکنز
31,975
ردِعمل کا وقت (اوسط)
1.31s
کل لاگت
$0.011
درجہ
#250
کل آؤٹ پٹ ٹوکنز
37,484
ردِعمل کا وقت (اوسط)
19.19s
کل لاگت
$0.021
تجویز کردہ ماڈل Mercury 2.5 Preview (low)

Its score stays close to the best score here (5.0 vs 5.1), while costing about 2.0x less than Qwen3.5-9B.

تفصیلی موازنہ

میٹرک Mercury 2.5 Preview Mercury 2.5 Preview low اجرا: 2026-09-02 Qwen3.5-9B Qwen3.5-9B none اجرا: 2026-03-02
اسکور 5.0 5.1
درجہ #254 #250
اعتماد پذیری 10.0 10.0
تسلسل 7.0 9.7
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 47.0% 19.7%
غیر مستحکم ٹیسٹ 8 1
کل رنز 66 66
فی نتیجہ لاگت 0.169 0.490
کل لاگت $0.011 $0.021
ان پٹ قیمت $0.040 / 1M $0.100 / 1M
آؤٹ پٹ قیمت $0.150 / 1M $0.150 / 1M
کل ان پٹ ٹوکنز 133,525 144,416
آؤٹ پٹ ٹوکنز 7,259 37,484
ریزننگ ٹوکنز 24,716 0
ردِعمل کا وقت (اوسط) 1.31s 19.19s
ردِعمل کا وقت (زیادہ سے زیادہ) 7.29s 382.06s
ردِعمل کا وقت (کل) 28.77s 422.25s
پیرامیٹرز ~100B 9B
دستیابی بند ماخذ کھلا ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#254 Mercury 2.5 Preview

low
لاگت
$0.001
وقت
1.5s
ٹوکنز
1,169 tok

#250 Qwen3.5-9B

none
غلط SVG
لاگت
$0.000
وقت
300.0s
ٹوکنز
0 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2.5 Preview 5.5 10.0 33.3% 0 972ms 7,794 695 2,263
Qwen3.5-9B 3.9 7.8 11.1% 1 5.60s 7,913 1,042 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں