نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 (low) vs GLM 5.2

average score تقریباً برابر ہے: 6.7 vs 6.7. GLM 5.2 کی benchmark لاگت کم ہے: $0.153 vs $0.412. GLM 5.2 تیز ہے: 9.65s vs 113.61s، pass rates 54.6% vs 63.6%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-03

درجہ
#152
کل آؤٹ پٹ ٹوکنز
320,594
ردِعمل کا وقت (اوسط)
113.61s
کل لاگت
$0.412
درجہ
#150
کل آؤٹ پٹ ٹوکنز
14,344
ردِعمل کا وقت (اوسط)
9.65s
کل لاگت
$0.153
تجویز کردہ ماڈل GLM 5.2

It has the best score here (6.7), while costing about 2.7x less than LongCat 2.0 (low).

تفصیلی موازنہ

میٹرک LongCat 2.0 LongCat 2.0 low اجرا: 2026-07-20 GLM 5.2 GLM 5.2 none اجرا: 2026-06-17
اسکور 6.7 6.7
درجہ #152 #150
اعتماد پذیری 9.9 10.0
تسلسل 8.5 9.2
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 54.6% 63.6%
غیر مستحکم ٹیسٹ 4 2
کل رنز 66 66
فی نتیجہ لاگت 4.120 1.312
کل لاگت $0.412 $0.153
ان پٹ قیمت $0.300 / 1M $0.966 / 1M
آؤٹ پٹ قیمت $1.200 / 1M $3.036 / 1M
کل ان پٹ ٹوکنز 90,870 112,458
آؤٹ پٹ ٹوکنز 5,676 14,344
ریزننگ ٹوکنز 314,918 0
ردِعمل کا وقت (اوسط) 113.61s 9.65s
ردِعمل کا وقت (زیادہ سے زیادہ) 560.39s 79.65s
ردِعمل کا وقت (کل) 2499.46s 212.38s
پیرامیٹرز 1.6T کل (48B فعال) 744B کل (40B فعال)
دستیابی کھلا ماخذ کھلا ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#152 LongCat 2.0

low
لاگت
$0.024
وقت
428.0s
ٹوکنز
19,557 tok

#150 GLM 5.2

none
غلط SVG
لاگت
$0.033
وقت
87.7s
ٹوکنز
7,455 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
GLM 5.2 3.7 9.5 0.0% 0 7.55s 7,263 1,958 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں