نیویگیشن
Advertise here

Mercury 2.5 (medium) vs KAT-Coder-Pro V2.5

average score تقریباً برابر ہے: 6.8 vs 6.7. Mercury 2.5 (medium) کی benchmark لاگت کم ہے: $0.022 vs $0.487. Mercury 2.5 (medium) تیز ہے: 3.19s vs 26.01s، pass rates 65.2% vs 71.2%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-08

موازنہ کیے گئے ماڈلز

درجہ
#157
کل آؤٹ پٹ ٹوکنز
120,129
ردِعمل کا وقت (اوسط)
3.19s
کل لاگت
$0.022
درجہ
#161
کل آؤٹ پٹ ٹوکنز
139,572
ردِعمل کا وقت (اوسط)
26.01s
کل لاگت
$0.487
تجویز کردہ ماڈل Mercury 2.5 (medium)

It has the best score here (6.8), while costing about 22.4x less than KAT-Coder-Pro V2.5.

تفصیلی موازنہ

میٹرک Mercury 2.5 Mercury 2.5 medium اجرا: 2026-09-08 KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 none اجرا: 2026-07-14
اسکور 6.8 6.7
درجہ #157 #161
اعتماد پذیری 9.8 10.0
تسلسل 8.6 7.0
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 65.2% 71.2%
غیر مستحکم ٹیسٹ 4 8
کل رنز 66 66
فی نتیجہ لاگت 0.181 4.419
کل لاگت $0.022 $0.487
ان پٹ قیمت $0.040 / 1M $0.740 / 1M
آؤٹ پٹ قیمت $0.150 / 1M $2.960 / 1M
کل ان پٹ ٹوکنز 91,402 98,508
آؤٹ پٹ ٹوکنز 3,138 139,572
ریزننگ ٹوکنز 116,991 0
ردِعمل کا وقت (اوسط) 3.19s 26.01s
ردِعمل کا وقت (زیادہ سے زیادہ) 9.87s 335.41s
ردِعمل کا وقت (کل) 70.18s 572.22s
پیرامیٹرز ~100B ~700B کل (~72B فعال)
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5

medium
لاگت
$0.001
وقت
3.8s
ٹوکنز
3,386 tok

#161 KAT-Coder-Pro V2.5

none
لاگت
$0.010
وقت
29.0s
ٹوکنز
3,439 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
KAT-Coder-Pro V2.5 6.1 4.7 66.7% 2 22.52s 7,893 22,440 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں