নেভিগেশন
Advertise here

DeepSeek V3.2 (medium) vs Mercury 2.5 (high)

Mercury 2.5 (high) average score-এ এগিয়ে: 7.1 vs 7.0. Mercury 2.5 (high)-এর benchmark খরচ কম: $0.031 vs $0.078. Mercury 2.5 (high) দ্রুত: 4.32s vs 68.43s, pass rates 65.2% vs 62.1%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-08

তুলনা করা মডেল

র‍্যাঙ্ক
#137
মোট আউটপুট টোকেন
128,787
প্রতিক্রিয়া সময় (গড়)
68.43s
মোট খরচ
$0.078
র‍্যাঙ্ক
#134
মোট আউটপুট টোকেন
174,547
প্রতিক্রিয়া সময় (গড়)
4.32s
মোট খরচ
$0.031
প্রস্তাবিত মডেল Mercury 2.5 (high)

It has the best score here (7.1), while costing about 2.5x less than DeepSeek V3.2 (medium).

বিস্তারিত তুলনা

মেট্রিক DeepSeek V3.2 DeepSeek V3.2 medium প্রকাশ: 2025-12-01 Mercury 2.5 Mercury 2.5 high প্রকাশ: 2026-09-08
স্কোর 7.0 7.1
র‍্যাঙ্ক #137 #134
নির্ভরযোগ্যতা 10.0 9.7
ধারাবাহিকতা 7.4 8.6
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 65.2% 62.1%
অস্থির টেস্ট 7 4
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.672 0.259
মোট খরচ $0.078 $0.031
ইনপুট মূল্য $0.269 / 1M $0.040 / 1M
আউটপুট মূল্য $0.400 / 1M $0.150 / 1M
মোট ইনপুট টোকেন 101,056 120,068
আউটপুট টোকেন 11,832 3,402
রিজনিং টোকেন 116,955 171,145
প্রতিক্রিয়া সময় (গড়) 68.43s 4.32s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 376.10s 23.63s
প্রতিক্রিয়া সময় (মোট) 1505.53s 95.06s
প্যারামিটার 671B মোট (37B সক্রিয়) ~100B
উপলভ্যতা উন্মুক্ত উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#137 DeepSeek V3.2

medium
খরচ
$0.001
সময়
53.6s
টোকেন
1,932 tok

#134 Mercury 2.5

high
খরচ
$0.001
সময়
3.5s
টোকেন
2,447 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
DeepSeek V3.2 6.0 7.2 55.6% 1 248.68s 5,717 649 52,014
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012

দ্রুত তুলনা

তুলনার জুটি বদলান