نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs GPT-5.5

average score تقریباً برابر ہے: 7.0 vs 7.0. Mercury 2 (medium) کی benchmark لاگت کم ہے: $0.094 vs $0.544. GPT-5.5 تیز ہے: 2.35s vs 2.95s، pass rates 53.0% vs 59.1%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-04

درجہ
#136
کل آؤٹ پٹ ٹوکنز
87,554
ردِعمل کا وقت (اوسط)
2.95s
کل لاگت
$0.094
درجہ
#135
کل آؤٹ پٹ ٹوکنز
4,915
ردِعمل کا وقت (اوسط)
2.35s
کل لاگت
$0.544
تجویز کردہ ماڈل Mercury 2 (medium)

It has the best score here (7.0), while costing about 5.8x less than GPT-5.5.

تفصیلی موازنہ

میٹرک Mercury 2 Mercury 2 medium اجرا: 2026-02-24 GPT-5.5 GPT-5.5 none اجرا: 2026-04-24
اسکور 7.0 7.0
درجہ #136 #135
اعتماد پذیری 10.0 10.0
تسلسل 8.4 9.2
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 53.0% 59.1%
غیر مستحکم ٹیسٹ 4 2
کل رنز 66 66
فی نتیجہ لاگت 0.933 4.533
کل لاگت $0.094 $0.544
ان پٹ قیمت $0.250 / 1M $5.000 / 1M
آؤٹ پٹ قیمت $0.750 / 1M $30.000 / 1M
کل ان پٹ ٹوکنز 110,515 79,294
آؤٹ پٹ ٹوکنز 10,325 4,915
ریزننگ ٹوکنز 77,229 0
ردِعمل کا وقت (اوسط) 2.95s 2.35s
ردِعمل کا وقت (زیادہ سے زیادہ) 14.63s 12.24s
ردِعمل کا وقت (کل) 61.89s 51.78s
پیرامیٹرز ~100B ~1.5T کل (~100B فعال)
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#136 Mercury 2

medium
لاگت
$0.002
وقت
2.1s
ٹوکنز
1,702 tok

#135 GPT-5.5

none
لاگت
$0.090
وقت
54.3s
ٹوکنز
3,063 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.5 5.5 10.0 33.3% 0 1.35s 7,305 462 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں