নেভিগেশন
AI BENCHY
Advertise here

Mercury 2 (medium) vs GPT-5.5

average score প্রায় সমান: 7.0 vs 7.0. Mercury 2 (medium)-এর benchmark খরচ কম: $0.094 vs $0.544. GPT-5.5 দ্রুত: 2.35s vs 2.95s, pass rates 53.0% vs 59.1%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-04

র‍্যাঙ্ক
#136
মোট আউটপুট টোকেন
87,554
প্রতিক্রিয়া সময় (গড়)
2.95s
মোট খরচ
$0.094
র‍্যাঙ্ক
#135
মোট আউটপুট টোকেন
4,915
প্রতিক্রিয়া সময় (গড়)
2.35s
মোট খরচ
$0.544
প্রস্তাবিত মডেল Mercury 2 (medium)

It has the best score here (7.0), while costing about 5.8x less than GPT-5.5.

বিস্তারিত তুলনা

মেট্রিক Mercury 2 Mercury 2 medium প্রকাশ: 2026-02-24 GPT-5.5 GPT-5.5 none প্রকাশ: 2026-04-24
স্কোর 7.0 7.0
র‍্যাঙ্ক #136 #135
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.4 9.2
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 53.0% 59.1%
অস্থির টেস্ট 4 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.933 4.533
মোট খরচ $0.094 $0.544
ইনপুট মূল্য $0.250 / 1M $5.000 / 1M
আউটপুট মূল্য $0.750 / 1M $30.000 / 1M
মোট ইনপুট টোকেন 110,515 79,294
আউটপুট টোকেন 10,325 4,915
রিজনিং টোকেন 77,229 0
প্রতিক্রিয়া সময় (গড়) 2.95s 2.35s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 14.63s 12.24s
প্রতিক্রিয়া সময় (মোট) 61.89s 51.78s
প্যারামিটার ~100B ~1.5T মোট (~100B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#136 Mercury 2

medium
খরচ
$0.002
সময়
2.1s
টোকেন
1,702 tok

#135 GPT-5.5

none
খরচ
$0.090
সময়
54.3s
টোকেন
3,063 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.5 5.5 10.0 33.3% 0 1.35s 7,305 462 0

দ্রুত তুলনা

তুলনার জুটি বদলান