নেভিগেশন
Advertise here

Mercury 2.5 (high) vs Grok 4.3 (medium)

average score প্রায় সমান: 7.1 vs 7.0. Mercury 2.5 (high)-এর benchmark খরচ কম: $0.031 vs $0.741. Mercury 2.5 (high) দ্রুত: 4.32s vs 44.21s, pass rates 62.1% vs 66.7%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-08

তুলনা করা মডেল

র‍্যাঙ্ক
#134
মোট আউটপুট টোকেন
174,547
প্রতিক্রিয়া সময় (গড়)
4.32s
মোট খরচ
$0.031
র‍্যাঙ্ক
#135
মোট আউটপুট টোকেন
225,904
প্রতিক্রিয়া সময় (গড়)
44.21s
মোট খরচ
$0.741
প্রস্তাবিত মডেল Mercury 2.5 (high)

It has the best score here (7.1), while costing about 23.9x less than Grok 4.3 (medium).

বিস্তারিত তুলনা

মেট্রিক Mercury 2.5 Mercury 2.5 high প্রকাশ: 2026-09-08 Grok 4.3 Grok 4.3 medium প্রকাশ: 2026-05-01
স্কোর 7.1 7.0
র‍্যাঙ্ক #134 #135
নির্ভরযোগ্যতা 9.7 10.0
ধারাবাহিকতা 8.6 8.2
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 62.1% 66.7%
অস্থির টেস্ট 4 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.259 6.168
মোট খরচ $0.031 $0.741
ইনপুট মূল্য $0.040 / 1M $1.250 / 1M
আউটপুট মূল্য $0.150 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 120,068 140,244
আউটপুট টোকেন 3,402 13,739
রিজনিং টোকেন 171,145 212,165
প্রতিক্রিয়া সময় (গড়) 4.32s 44.21s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 23.63s 216.69s
প্রতিক্রিয়া সময় (মোট) 95.06s 972.64s
প্যারামিটার ~100B ~1.5T মোট (~150B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
খরচ
$0.001
সময়
3.5s
টোকেন
2,447 tok

#135 SpaceXAI: Grok 4.3

medium
খরচ
$0.009
সময়
19.0s
টোকেন
3,661 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

দ্রুত তুলনা

তুলনার জুটি বদলান