নেভিগেশন
Advertise here

Mercury 2.5 Preview (medium) vs GPT-6 Sol

average score প্রায় সমান: 6.8 vs 6.8. Mercury 2.5 Preview (medium)-এর benchmark খরচ কম: $0.037 vs $0.551. Mercury 2.5 Preview (medium) দ্রুত: 6.66s vs 9.02s, pass rates 66.7% vs 63.8%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-10-01

তুলনা করা মডেল

র‍্যাঙ্ক
#171
মোট আউটপুট টোকেন
150,107
প্রতিক্রিয়া সময় (গড়)
6.66s
মোট খরচ
$0.037
র‍্যাঙ্ক
#172
মোট আউটপুট টোকেন
7,989
প্রতিক্রিয়া সময় (গড়)
9.02s
মোট খরচ
$0.551
প্রস্তাবিত মডেল Mercury 2.5 Preview (medium)

It has the best score here (6.8), while costing about 15.0x less than GPT-6 Sol.

বিস্তারিত তুলনা

মেট্রিক Mercury 2.5 Preview Mercury 2.5 Preview medium প্রকাশ: 2026-09-02 GPT-6 Sol GPT-6 Sol none প্রকাশ: 2026-09-23
স্কোর 6.8 6.8
র‍্যাঙ্ক #171 #172
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.6 8.5
প্রচেষ্টা 69/69 69/69
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 66.7% 63.8%
অস্থির টেস্ট 1 4
মোট রান 69 69
প্রতি ফলাফলে খরচ 0.244 4.232
মোট খরচ $0.037 $0.551
ইনপুট মূল্য $0.000 / 1M $2.000 / 1M
আউটপুট মূল্য $0.000 / 1M $10.000 / 1M
মোট ইনপুট টোকেন 397,291 235,086
আউটপুট টোকেন 6,355 7,989
রিজনিং টোকেন 143,752 0
প্রতিক্রিয়া সময় (গড়) 6.66s 9.02s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 74.63s 57.02s
প্রতিক্রিয়া সময় (মোট) 153.29s 207.45s
প্যারামিটার ~100B ~2T মোট (~150B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#171 Mercury 2.5 Preview

medium
খরচ
$0.001
সময়
2.7s
টোকেন
2,241 tok

#172 GPT-6 Sol

none
খরচ
$0.030
সময়
31.9s
টোকেন
3,055 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-6 Sol 5.5 10.0 33.3% 0 12.23s 7,302 389 0

দ্রুত তুলনা

তুলনার জুটি বদলান