নেভিগেশন
Advertise here

Qwen3.8 Max (medium) vs Pareto

Qwen3.8 Max (medium) average score-এ এগিয়ে: 9.0 vs 8.9. Qwen3.8 Max (medium)-এর benchmark খরচ কম: $0.771 vs $1.172. Qwen3.8 Max (medium) দ্রুত: 23.34s vs 31.51s, pass rates 80.3% vs 86.4%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-18

তুলনা করা মডেল

র‍্যাঙ্ক
#29
মোট আউটপুট টোকেন
92,047
প্রতিক্রিয়া সময় (গড়)
23.34s
মোট খরচ
$0.771
র‍্যাঙ্ক
#34
মোট আউটপুট টোকেন
119,230
প্রতিক্রিয়া সময় (গড়)
31.51s
মোট খরচ
$1.172
প্রস্তাবিত মডেল Qwen3.8 Max (medium)

It has the best score here (9.0), while costing about 1.5x less than Pareto.

বিস্তারিত তুলনা

মেট্রিক Qwen3.8 Max Qwen3.8 Max medium প্রকাশ: 2026-08-04 Pareto Pareto none প্রকাশ: 2026-09-18
স্কোর 9.0 8.9
র‍্যাঙ্ক #29 #34
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 9.2
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 80.3% 86.4%
অস্থির টেস্ট 1 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 4.532 6.506
মোট খরচ $0.771 $1.172
ইনপুট মূল্য $2.000 / 1M $2.500 / 1M
আউটপুট মূল্য $6.000 / 1M $7.500 / 1M
মোট ইনপুট টোকেন 109,055 110,734
আউটপুট টোকেন 6,566 119,230
রিজনিং টোকেন 85,481 0
প্রতিক্রিয়া সময় (গড়) 23.34s 31.51s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 126.60s 143.33s
প্রতিক্রিয়া সময় (মোট) 513.47s 693.29s
প্যারামিটার 2.4T মোট (~100B সক্রিয়) -
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 Qwen3.8 Max

medium
খরচ
$0.028
সময়
71.9s
টোকেন
4,750 tok

#34 Pareto

none
খরচ
$0.034
সময়
170.7s
টোকেন
4,581 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

দ্রুত তুলনা

তুলনার জুটি বদলান