নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen3.8 27B (high) vs Grok 4.5 (medium)

Grok 4.5 (medium) average score-এ এগিয়ে: 8.5 vs 8.4. স্থানীয় হার্ডওয়্যারের খরচ মাপা হয়নি, তাই খরচের তুলনা পাওয়া যায় না। Grok 4.5 (medium) দ্রুত: 68.59s vs 167.89s, pass rates 77.3% vs 83.3%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-15

র‍্যাঙ্ক
#42
মোট আউটপুট টোকেন
656,635
প্রতিক্রিয়া সময় (গড়)
167.89s
মোট খরচ
প্রযোজ্য নয়
র‍্যাঙ্ক
#37
মোট আউটপুট টোকেন
299,460
প্রতিক্রিয়া সময় (গড়)
68.59s
মোট খরচ
$2.042
প্রস্তাবিত মডেল Grok 4.5 (medium)

It has the best score here (8.5), while responding about 2.4x faster than Qwen3.8 27B (high).

বিস্তারিত তুলনা

মেট্রিক Qwen3.8 27B Qwen3.8 27B high প্রকাশ: 2026-08-14 Grok 4.5 Grok 4.5 medium প্রকাশ: 2026-07-08
স্কোর 8.4 8.5
র‍্যাঙ্ক #42 #37
নির্ভরযোগ্যতা 9.6 10.0
ধারাবাহিকতা 9.2 8.9
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 77.3% 83.3%
অস্থির টেস্ট 2 3
মোট রান 66 66
প্রতি ফলাফলে খরচ প্রযোজ্য নয় 12.007
মোট খরচ প্রযোজ্য নয় $2.042
ইনপুট মূল্য প্রযোজ্য নয় $2.000 / 1M
আউটপুট মূল্য প্রযোজ্য নয় $6.000 / 1M
মোট ইনপুট টোকেন 100,179 122,155
আউটপুট টোকেন 904 5,514
রিজনিং টোকেন 655,731 293,946
প্রতিক্রিয়া সময় (গড়) 167.89s 68.59s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 640.85s 436.38s
প্রতিক্রিয়া সময় (মোট) 3693.54s 1508.91s
প্যারামিটার 27.3B ~1.7T মোট (~170B সক্রিয়)
উপলভ্যতা ওজন উপলভ্য বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#42 Qwen3.8 27B

high
খরচ
প্রযোজ্য নয়
সময়
270.1s
টোকেন
18,963 tok

#37 SpaceXAI: Grok 4.5

medium
খরচ
$0.044
সময়
59.4s
টোকেন
7,512 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.8 27B 8.1 7.0 88.9% 1 248.62s 8,235 346 143,335
Grok 4.5 7.6 7.2 77.8% 1 155.69s 9,579 390 104,634

দ্রুত তুলনা

তুলনার জুটি বদলান

GPT-5.2mediumvsQwen3.8 27BhighSeed 2.1 TurbomediumvsQwen3.8 27BhighMuse Spark 1.2lowvsGrok 4.5mediumQwen3.8 27BhighvsGrok 4.5lowQwen3.8 27BhighvsGrok 4.6mediumMuse Spark 1.2lowvsQwen3.8 27BhighMuse Spark 1.1lowvsQwen3.8 27BhighQwen3.8 MaxlowvsGrok 4.5mediumInkling SmallhighvsGrok 4.5mediumGPT-5.4mediumvsQwen3.8 27BhighGemini 2.5 FlashmediumvsQwen3.8 27BhighMuse Spark 1.1lowvsGrok 4.5medium