نیویگیشن
AI BENCHY
Advertise here

KAT-Coder-Air V2.5 (medium) vs GLM 5.1

GLM 5.1 average score میں آگے ہے: 5.7 vs 5.6. KAT-Coder-Air V2.5 (medium) کی benchmark لاگت کم ہے: $0.048 vs $0.214. GLM 5.1 تیز ہے: 6.74s vs 8.65s، pass rates 45.5% vs 45.5%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-08-26

درجہ
#215
کل آؤٹ پٹ ٹوکنز
66,576
ردِعمل کا وقت (اوسط)
8.65s
کل لاگت
$0.048
درجہ
#205
کل آؤٹ پٹ ٹوکنز
14,393
ردِعمل کا وقت (اوسط)
6.74s
کل لاگت
$0.214
تجویز کردہ ماڈل KAT-Coder-Air V2.5 (medium)

Its score stays close to the best score here (5.6 vs 5.7), while costing about 4.5x less than GLM 5.1.

تفصیلی موازنہ

میٹرک KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 medium اجرا: 2026-07-14 GLM 5.1 GLM 5.1 none اجرا: 2026-04-07
اسکور 5.6 5.7
درجہ #215 #205
اعتماد پذیری 9.6 10.0
تسلسل 8.9 8.2
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 45.5% 45.5%
غیر مستحکم ٹیسٹ 3 5
کل رنز 66 66
فی نتیجہ لاگت 0.596 2.073
کل لاگت $0.048 $0.214
ان پٹ قیمت $0.150 / 1M $1.260 / 1M
آؤٹ پٹ قیمت $0.600 / 1M $3.961 / 1M
کل ان پٹ ٹوکنز 51,369 124,219
آؤٹ پٹ ٹوکنز 8,008 14,393
ریزننگ ٹوکنز 58,568 0
ردِعمل کا وقت (اوسط) 8.65s 6.74s
ردِعمل کا وقت (زیادہ سے زیادہ) 48.19s 61.20s
ردِعمل کا وقت (کل) 190.35s 148.20s
پیرامیٹرز ~35B کل (~3B فعال) 744B کل (40B فعال)
دستیابی بند ماخذ کھلا ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#215 KAT-Coder-Air V2.5

medium
لاگت
$0.003
وقت
23.7s
ٹوکنز
4,924 tok

#205 GLM 5.1

none
غلط SVG
لاگت
$0.000
وقت
300.0s
ٹوکنز
0 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
KAT-Coder-Air V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973
GLM 5.1 3.9 9.7 0.0% 0 4.96s 7,256 525 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں