নেভিগেশন
Advertise here

তুলনা করা মডেল

Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high) benchmark তুলনা: Grok 4.6 (high) স্কোর-এ 9.3 নিয়ে এগিয়ে। Grok 4.6 (high) নির্ভরযোগ্যতা-এ 10.0 নিয়ে এগিয়ে। Grok 4.6 (high)-এর মোট খরচ সবচেয়ে কম, $1.908. Grok 4.6 (high) 84.15s-এ সবচেয়ে দ্রুত।

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-24

তুলনা করা মডেল

র‍্যাঙ্ক
#78
মোট আউটপুট টোকেন
495,541
প্রতিক্রিয়া সময় (গড়)
118.97s
মোট খরচ
$2.672
র‍্যাঙ্ক
#133
মোট আউটপুট টোকেন
456,028
প্রতিক্রিয়া সময় (গড়)
120.59s
মোট খরচ
$2.357
র‍্যাঙ্ক
#19
মোট আউটপুট টোকেন
282,217
প্রতিক্রিয়া সময় (গড়)
84.15s
মোট খরচ
$1.908
প্রস্তাবিত মডেল Grok 4.6 (high)

It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 3 models.

বিস্তারিত তুলনা

মেট্রিক Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low প্রকাশ: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high প্রকাশ: 2026-08-12 Grok 4.6 Grok 4.6 high প্রকাশ: 2026-08-12
স্কোর 8.1 7.4 9.3
র‍্যাঙ্ক #78 #133 #19
নির্ভরযোগ্যতা 9.4 9.4 10.0
ধারাবাহিকতা 9.2 8.3 10.0
প্রচেষ্টা 66/66 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 72.7% 74.2% 86.4%
অস্থির টেস্ট 2 4 0
মোট রান 66 66 66
প্রতি ফলাফলে খরচ 17.812 16.832 10.042
মোট খরচ $2.672 $2.357 $1.908
ইনপুট মূল্য $2.000 / 1M $2.000 / 1M $2.000 / 1M
আউটপুট মূল্য $6.000 / 1M $6.000 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 113,279 108,931 107,275
আউটপুট টোকেন 121,045 112,801 5,094
রিজনিং টোকেন 374,496 343,227 277,123
প্রতিক্রিয়া সময় (গড়) 118.97s 120.59s 84.15s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 534.21s 532.28s 618.49s
প্রতিক্রিয়া সময় (মোট) 2617.41s 2653.05s 1851.26s
প্যারামিটার 2.4T মোট (95B সক্রিয়) 2.4T মোট (95B সক্রিয়) ~1.7T মোট (~170B সক্রিয়)
উপলভ্যতা ওজন উপলভ্য ওজন উপলভ্য বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 Qwen3.8 2.4T A95B

low
খরচ
$0.100
সময়
193.2s
টোকেন
16,767 tok

#133 Qwen3.8 2.4T A95B

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#19 SpaceXAI: Grok 4.6

high
খরচ
$0.107
সময়
265.1s
টোকেন
18,001 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

দ্রুত তুলনা

তুলনার জুটি বদলান