নেভিগেশন
AI BENCHY
Advertise here

তুলনা করা মডেল

Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high) benchmark তুলনা: Grok 4.6 (high) স্কোর-এ 9.2 নিয়ে এগিয়ে। Grok 4.6 (high) নির্ভরযোগ্যতা-এ 10.0 নিয়ে এগিয়ে। Grok 4.6 (high)-এর মোট খরচ সবচেয়ে কম, $1.809. Grok 4.6 (high) 79.38s-এ সবচেয়ে দ্রুত।

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-12

র‍্যাঙ্ক
#46
মোট আউটপুট টোকেন
554,485
প্রতিক্রিয়া সময় (গড়)
132.39s
মোট খরচ
$3.113
র‍্যাঙ্ক
#85
মোট আউটপুট টোকেন
512,351
প্রতিক্রিয়া সময় (গড়)
134.41s
মোট খরচ
$2.755
র‍্যাঙ্ক
#11
মোট আউটপুট টোকেন
265,604
প্রতিক্রিয়া সময় (গড়)
79.38s
মোট খরচ
$1.809
প্রস্তাবিত মডেল Grok 4.6 (high)

It has the best score here (9.2), while costing about 1.6x less than এই তুলনার অন্য মডেলগুলো.

বিস্তারিত তুলনা

মেট্রিক Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low প্রকাশ: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high প্রকাশ: 2026-08-12 Grok 4.6 Grok 4.6 high প্রকাশ: 2026-08-12
স্কোর 8.2 7.5 9.2
র‍্যাঙ্ক #46 #85 #11
নির্ভরযোগ্যতা 9.1 8.8 10.0
ধারাবাহিকতা 8.9 8.4 9.6
প্রচেষ্টা 66/66 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 78.8% 77.3% 84.9%
অস্থির টেস্ট 3 4 1
মোট রান 66 66 66
প্রতি ফলাফলে খরচ 19.453 18.365 10.046
মোট খরচ $3.113 $2.755 $1.809
ইনপুট মূল্য $2.000 / 1M $2.000 / 1M $2.000 / 1M
আউটপুট মূল্য $6.000 / 1M $6.000 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 113,340 109,036 107,266
আউটপুট টোকেন 107,311 103,736 5,094
রিজনিং টোকেন 447,174 408,615 260,510
প্রতিক্রিয়া সময় (গড়) 132.39s 134.41s 79.38s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 534.21s 532.28s 618.49s
প্রতিক্রিয়া সময় (মোট) 2912.56s 2956.97s 1746.29s
প্যারামিটার 2.4T মোট (95B সক্রিয়) 2.4T মোট (95B সক্রিয়) ~1.7T মোট (~170B সক্রিয়)
উপলভ্যতা ওজন উপলভ্য ওজন উপলভ্য বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 Qwen3.8 2.4T A95B

low
খরচ
$0.100
সময়
193.2s
টোকেন
16,767 tok

#85 Qwen3.8 2.4T A95B

high
অবৈধ SVG
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#11 SpaceXAI: Grok 4.6

high
খরচ
$0.107
সময়
265.1s
টোকেন
18,001 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.8 2.4T A95B 7.6 7.2 77.8% 1 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

দ্রুত তুলনা

তুলনার জুটি বদলান