নেভিগেশন
AI BENCHY
Advertise here

Inception: Mercury 2 vs OpenAI: GPT-5.5

Mercury 2 (medium) average score-এ এগিয়ে: 7.0 vs 6.9. Mercury 2 (medium)-এর benchmark খরচ কম: $0.093 vs $0.544. GPT-5.5 দ্রুত: 2.36s vs 2.72s, pass rates 51.5% vs 56.1%.

প্রস্তাবিত মডেলMercury 2 (medium)It has the best score here (7.0), while costing about 5.9x less than GPT-5.5.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-24

মেট্রিক Mercury 2 Mercury 2 medium প্রকাশ: 2026-02-24 GPT-5.5 GPT-5.5 none প্রকাশ: 2026-04-24
স্কোর 7.0 6.9
র‍্যাঙ্ক #82 #91
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.8 8.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 51.5% 56.1%
অস্থির টেস্ট 3 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.928 4.945
মোট খরচ $0.093 $0.544
ইনপুট মূল্য $0.250 / 1M $5.000 / 1M
আউটপুট মূল্য $0.750 / 1M $30.000 / 1M
মোট ইনপুট টোকেন 109,572 79,285
আউটপুট টোকেন 10,313 4,915
রিজনিং টোকেন 76,806 0
প্রতিক্রিয়া সময় (গড়) 2.72s 2.36s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 14.63s 12.24s
প্রতিক্রিয়া সময় (মোট) 57.12s 51.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#82 Mercury 2

medium
খরচ
$0.002
সময়
2.1s
টোকেন
1,702 tok

#91 GPT-5.5

none
খরচ
$0.090
সময়
54.3s
টোকেন
3,063 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.5 5.5 10.0 33.3% 0 1.35s 7,305 462 0

দ্রুত তুলনা

তুলনার জুটি বদলান