نیویگیشن
AI BENCHY
Advertise here

Claude Fable 5.1 (low) vs Mercury 2 (medium)

Mercury 2 (medium) average score میں آگے ہے: 7.0 vs 6.9. Mercury 2 (medium) کی benchmark لاگت کم ہے: $0.094 vs $2.565. Mercury 2 (medium) تیز ہے: 2.95s vs 10.33s، pass rates 56.1% vs 53.0%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-09-02

درجہ
#130
کل آؤٹ پٹ ٹوکنز
24,375
ردِعمل کا وقت (اوسط)
10.33s
کل لاگت
$2.565
درجہ
#125
کل آؤٹ پٹ ٹوکنز
87,554
ردِعمل کا وقت (اوسط)
2.95s
کل لاگت
$0.094
تجویز کردہ ماڈل Mercury 2 (medium)

It has the best score here (7.0), while costing about 27.5x less than Claude Fable 5.1 (low).

تفصیلی موازنہ

میٹرک Claude Fable 5.1 Claude Fable 5.1 low اجرا: 2026-09-02 Mercury 2 Mercury 2 medium اجرا: 2026-02-24
اسکور 6.9 7.0
درجہ #130 #125
اعتماد پذیری 10.0 10.0
تسلسل 9.2 8.4
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 56.1% 53.0%
غیر مستحکم ٹیسٹ 2 4
کل رنز 66 66
فی نتیجہ لاگت 23.315 0.933
کل لاگت $2.565 $0.094
ان پٹ قیمت $10.000 / 1M $0.250 / 1M
آؤٹ پٹ قیمت $50.000 / 1M $0.750 / 1M
کل ان پٹ ٹوکنز 134,582 110,515
آؤٹ پٹ ٹوکنز 8,955 10,325
ریزننگ ٹوکنز 15,420 77,229
ردِعمل کا وقت (اوسط) 10.33s 2.95s
ردِعمل کا وقت (زیادہ سے زیادہ) 33.10s 14.63s
ردِعمل کا وقت (کل) 227.37s 61.89s
پیرامیٹرز ~9.5T کل (~878B فعال) ~100B
دستیابی بند ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#130 Claude Fable 5.1

low
لاگت
$0.126
وقت
28.5s
ٹوکنز
2,652 tok

#125 Mercury 2

medium
لاگت
$0.002
وقت
2.1s
ٹوکنز
1,702 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Claude Fable 5.1 3.4 10.0 0.0% 0 6.75s 10,608 1,753 0
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں