نیویگیشن
Advertise here

Ember-1 (high) vs Mercury 2 (medium)

Ember-1 (high) average score میں آگے ہے: 7.1 vs 7.0. Mercury 2 (medium) کی benchmark لاگت کم ہے: $0.094 vs $1.798. Mercury 2 (medium) تیز ہے: 2.95s vs 56.77s، pass rates 71.2% vs 53.0%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-28

موازنہ کیے گئے ماڈلز

درجہ
#158
کل آؤٹ پٹ ٹوکنز
110,125
ردِعمل کا وقت (اوسط)
56.77s
کل لاگت
$1.798
درجہ
#166
کل آؤٹ پٹ ٹوکنز
87,554
ردِعمل کا وقت (اوسط)
2.95s
کل لاگت
$0.094
تجویز کردہ ماڈل Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.1), while costing about 19.3x less than Ember-1 (high).

تفصیلی موازنہ

میٹرک Ember-1 Ember-1 high اجرا: 2026-09-28 Mercury 2 Mercury 2 medium اجرا: 2026-02-24
اسکور 7.1 7.0
درجہ #158 #166
اعتماد پذیری 8.0 10.0
تسلسل 7.3 8.4
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 71.2% 53.0%
غیر مستحکم ٹیسٹ 7 4
کل رنز 66 66
فی نتیجہ لاگت 14.981 0.933
کل لاگت $1.798 $0.094
ان پٹ قیمت $3.000 / 1M $0.250 / 1M
آؤٹ پٹ قیمت $15.000 / 1M $0.750 / 1M
کل ان پٹ ٹوکنز 48,577 110,515
آؤٹ پٹ ٹوکنز 7,345 10,325
ریزننگ ٹوکنز 102,780 77,229
ردِعمل کا وقت (اوسط) 56.77s 2.95s
ردِعمل کا وقت (زیادہ سے زیادہ) 255.06s 14.63s
ردِعمل کا وقت (کل) 1248.88s 61.89s
پیرامیٹرز ~2.8T کل (~104B فعال) ~100B
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#158 Ember-1

high
لاگت
$0.038
وقت
55.1s
ٹوکنز
2,671 tok

#166 Mercury 2

medium
لاگت
$0.002
وقت
2.1s
ٹوکنز
1,702 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں