নেভিগেশন
AI BENCHY
Advertise here

Claude Fable 5.1 (low) vs Mercury 2 (medium)

Mercury 2 (medium) average score-এ এগিয়ে: 7.0 vs 6.9. Mercury 2 (medium)-এর benchmark খরচ কম: $0.094 vs $2.565. Mercury 2 (medium) দ্রুত: 2.95s vs 10.33s, pass rates 56.1% vs 53.0%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-02

র‍্যাঙ্ক
#130
মোট আউটপুট টোকেন
24,375
প্রতিক্রিয়া সময় (গড়)
10.33s
মোট খরচ
$2.565
র‍্যাঙ্ক
#125
মোট আউটপুট টোকেন
87,554
প্রতিক্রিয়া সময় (গড়)
2.95s
মোট খরচ
$0.094
প্রস্তাবিত মডেল Mercury 2 (medium)

It has the best score here (7.0), while costing about 27.5x less than Claude Fable 5.1 (low).

বিস্তারিত তুলনা

মেট্রিক Claude Fable 5.1 Claude Fable 5.1 low প্রকাশ: 2026-09-02 Mercury 2 Mercury 2 medium প্রকাশ: 2026-02-24
স্কোর 6.9 7.0
র‍্যাঙ্ক #130 #125
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.2 8.4
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 56.1% 53.0%
অস্থির টেস্ট 2 4
মোট রান 66 66
প্রতি ফলাফলে খরচ 23.315 0.933
মোট খরচ $2.565 $0.094
ইনপুট মূল্য $10.000 / 1M $0.250 / 1M
আউটপুট মূল্য $50.000 / 1M $0.750 / 1M
মোট ইনপুট টোকেন 134,582 110,515
আউটপুট টোকেন 8,955 10,325
রিজনিং টোকেন 15,420 77,229
প্রতিক্রিয়া সময় (গড়) 10.33s 2.95s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 33.10s 14.63s
প্রতিক্রিয়া সময় (মোট) 227.37s 61.89s
প্যারামিটার ~9.5T মোট (~878B সক্রিয়) ~100B
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#130 Claude Fable 5.1

low
খরচ
$0.126
সময়
28.5s
টোকেন
2,652 tok

#125 Mercury 2

medium
খরচ
$0.002
সময়
2.1s
টোকেন
1,702 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Fable 5.1 3.4 10.0 0.0% 0 6.75s 10,608 1,753 0
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

দ্রুত তুলনা

তুলনার জুটি বদলান