نیویگیشن
Advertise here

Mercury 2.5 (high) vs GLM 5.1 (medium)

Mercury 2.5 (high) average score میں آگے ہے: 7.1 vs 7.0. Mercury 2.5 (high) کی benchmark لاگت کم ہے: $0.031 vs $0.727. Mercury 2.5 (high) تیز ہے: 4.32s vs 58.80s، pass rates 62.1% vs 65.2%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-08

موازنہ کیے گئے ماڈلز

درجہ
#134
کل آؤٹ پٹ ٹوکنز
174,547
ردِعمل کا وقت (اوسط)
4.32s
کل لاگت
$0.031
درجہ
#138
کل آؤٹ پٹ ٹوکنز
215,889
ردِعمل کا وقت (اوسط)
58.80s
کل لاگت
$0.727
تجویز کردہ ماڈل Mercury 2.5 (high)

It has the best score here (7.1), while costing about 23.4x less than GLM 5.1 (medium).

تفصیلی موازنہ

میٹرک Mercury 2.5 Mercury 2.5 high اجرا: 2026-09-08 GLM 5.1 GLM 5.1 medium اجرا: 2026-04-07
اسکور 7.1 7.0
درجہ #134 #138
اعتماد پذیری 9.7 8.1
تسلسل 8.6 8.4
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 62.1% 65.2%
غیر مستحکم ٹیسٹ 4 4
کل رنز 66 66
فی نتیجہ لاگت 0.259 6.923
کل لاگت $0.031 $0.727
ان پٹ قیمت $0.040 / 1M $0.966 / 1M
آؤٹ پٹ قیمت $0.150 / 1M $3.036 / 1M
کل ان پٹ ٹوکنز 120,068 82,592
آؤٹ پٹ ٹوکنز 3,402 16,089
ریزننگ ٹوکنز 171,145 199,800
ردِعمل کا وقت (اوسط) 4.32s 58.80s
ردِعمل کا وقت (زیادہ سے زیادہ) 23.63s 308.75s
ردِعمل کا وقت (کل) 95.06s 1234.72s
پیرامیٹرز ~100B 744B کل (40B فعال)
دستیابی بند ماخذ کھلا ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
لاگت
$0.001
وقت
3.5s
ٹوکنز
2,447 tok

#138 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
لاگت
$0.000
وقت
300.0s
ٹوکنز
0 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں