نیویگیشن
Advertise here

Ember-1 (high) vs Mercury 2.5 (high)

average score تقریباً برابر ہے: 7.1 vs 7.1. Mercury 2.5 (high) کی benchmark لاگت کم ہے: $0.031 vs $1.798. Mercury 2.5 (high) تیز ہے: 4.32s vs 56.77s، pass rates 71.2% vs 62.1%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-28

موازنہ کیے گئے ماڈلز

درجہ
#158
کل آؤٹ پٹ ٹوکنز
110,125
ردِعمل کا وقت (اوسط)
56.77s
کل لاگت
$1.798
درجہ
#157
کل آؤٹ پٹ ٹوکنز
174,547
ردِعمل کا وقت (اوسط)
4.32s
کل لاگت
$0.031
تجویز کردہ ماڈل Mercury 2.5 (high)

It has the best score here (7.1), while costing about 58.0x less than Ember-1 (high).

تفصیلی موازنہ

میٹرک Ember-1 Ember-1 high اجرا: 2026-09-28 Mercury 2.5 Mercury 2.5 high اجرا: 2026-09-08
اسکور 7.1 7.1
درجہ #158 #157
اعتماد پذیری 8.0 9.7
تسلسل 7.3 8.6
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 71.2% 62.1%
غیر مستحکم ٹیسٹ 7 4
کل رنز 66 66
فی نتیجہ لاگت 14.981 0.259
کل لاگت $1.798 $0.031
ان پٹ قیمت $3.000 / 1M $0.040 / 1M
آؤٹ پٹ قیمت $15.000 / 1M $0.150 / 1M
کل ان پٹ ٹوکنز 48,577 120,068
آؤٹ پٹ ٹوکنز 7,345 3,402
ریزننگ ٹوکنز 102,780 171,145
ردِعمل کا وقت (اوسط) 56.77s 4.32s
ردِعمل کا وقت (زیادہ سے زیادہ) 255.06s 23.63s
ردِعمل کا وقت (کل) 1248.88s 95.06s
پیرامیٹرز ~2.8T کل (~104B فعال) ~100B
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#158 Ember-1

high
لاگت
$0.038
وقت
55.1s
ٹوکنز
2,671 tok

#157 Mercury 2.5

high
لاگت
$0.001
وقت
3.5s
ٹوکنز
2,447 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں