نیویگیشن
Advertise here

Mercury 2.5 (low) vs KAT Coder AIR V2.5 (medium)

average score تقریباً برابر ہے: 5.1 vs 5.1. Mercury 2.5 (low) کی benchmark لاگت کم ہے: $0.020 vs $0.048. Mercury 2.5 (low) تیز ہے: 3.34s vs 8.32s، pass rates 37.7% vs 43.5%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-10-01

موازنہ کیے گئے ماڈلز

درجہ
#293
کل آؤٹ پٹ ٹوکنز
40,302
ردِعمل کا وقت (اوسط)
3.34s
کل لاگت
$0.020
درجہ
#294
کل آؤٹ پٹ ٹوکنز
66,576
ردِعمل کا وقت (اوسط)
8.32s
کل لاگت
$0.048
تجویز کردہ ماڈل Mercury 2.5 (low)

It has the best score here (5.1), while costing about 2.5x less than KAT Coder AIR V2.5 (medium).

تفصیلی موازنہ

میٹرک Mercury 2.5 Mercury 2.5 low اجرا: 2026-09-08 KAT Coder AIR V2.5 KAT Coder AIR V2.5 medium اجرا: 2026-07-14
اسکور 5.1 5.1
درجہ #293 #294
اعتماد پذیری 9.8 9.6
تسلسل 8.2 8.9
کوششیں 69/69 69/69
درست ٹیسٹس
فی کوشش کامیابی کی شرح 37.7% 43.5%
غیر مستحکم ٹیسٹ 5 3
کل رنز 69 69
فی نتیجہ لاگت 0.319 0.596
کل لاگت $0.020 $0.048
ان پٹ قیمت $0.040 / 1M $0.000 / 1M
آؤٹ پٹ قیمت $0.150 / 1M $0.000 / 1M
کل ان پٹ ٹوکنز 326,083 51,369
آؤٹ پٹ ٹوکنز 7,224 8,008
ریزننگ ٹوکنز 33,078 58,568
ردِعمل کا وقت (اوسط) 3.34s 8.32s
ردِعمل کا وقت (زیادہ سے زیادہ) 47.06s 48.19s
ردِعمل کا وقت (کل) 76.80s 191.40s
پیرامیٹرز ~100B ~35B کل (~3B فعال)
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#293 Mercury 2.5

low
لاگت
$0.001
وقت
2.4s
ٹوکنز
1,236 tok

#294 KAT Coder AIR V2.5

medium
لاگت
$0.003
وقت
23.7s
ٹوکنز
4,924 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
KAT Coder AIR V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں