نیویگیشن
AI BENCHY
Advertise here

Mercury 2 (medium) vs GPT-5.6 Sol

average score تقریباً برابر ہے: 7.0 vs 7.0. Mercury 2 (medium) کی benchmark لاگت کم ہے: $0.094 vs $0.201. GPT-5.6 Sol تیز ہے: 2.17s vs 2.95s، pass rates 53.0% vs 63.6%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-08-29

درجہ
#122
کل آؤٹ پٹ ٹوکنز
87,554
ردِعمل کا وقت (اوسط)
2.95s
کل لاگت
$0.094
درجہ
#118
کل آؤٹ پٹ ٹوکنز
4,357
ردِعمل کا وقت (اوسط)
2.17s
کل لاگت
$0.201
تجویز کردہ ماڈل Mercury 2 (medium)

It has the best score here (7.0), while costing about 2.2x less than GPT-5.6 Sol.

تفصیلی موازنہ

میٹرک Mercury 2 Mercury 2 medium اجرا: 2026-02-24 GPT-5.6 Sol GPT-5.6 Sol none اجرا: 2026-07-09
اسکور 7.0 7.0
درجہ #122 #118
اعتماد پذیری 10.0 10.0
تسلسل 8.4 9.0
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 53.0% 63.6%
غیر مستحکم ٹیسٹ 4 3
کل رنز 66 66
فی نتیجہ لاگت 0.933 4.365
کل لاگت $0.094 $0.201
ان پٹ قیمت $0.250 / 1M $2.000 / 1M
آؤٹ پٹ قیمت $0.750 / 1M $10.000 / 1M
کل ان پٹ ٹوکنز 110,515 78,602
آؤٹ پٹ ٹوکنز 10,325 4,357
ریزننگ ٹوکنز 77,229 0
ردِعمل کا وقت (اوسط) 2.95s 2.17s
ردِعمل کا وقت (زیادہ سے زیادہ) 14.63s 12.81s
ردِعمل کا وقت (کل) 61.89s 47.66s
پیرامیٹرز ~100B ~2T کل (~150B فعال)
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 Mercury 2

medium
لاگت
$0.002
وقت
2.1s
ٹوکنز
1,702 tok

#118 GPT-5.6 Sol

none
لاگت
$0.116
وقت
78.7s
ٹوکنز
3,944 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.6 Sol 5.5 10.0 33.3% 0 1.39s 7,302 390 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں