নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen: Qwen3.5-9B vs xAI: Grok 4.20

Grok 4.20 average score-এ এগিয়ে: 4.1 vs 3.8. Qwen3.5-9B (medium)-এর benchmark খরচ কম: $0.036 vs $0.057. Grok 4.20 দ্রুত: 1.11s vs 82.24s, pass rates 25.8% vs 27.3%.

প্রস্তাবিত মডেলGrok 4.20It has the best score here (4.1), while responding about 74.2x faster than Qwen3.5-9B (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

মেট্রিক Qwen3.5-9B Qwen3.5-9B medium প্রকাশ: 2026-03-02 Grok 4.20 Grok 4.20 none প্রকাশ: 2026-03-31
স্কোর 3.8 4.1
র‍্যাঙ্ক #220 #213
নির্ভরযোগ্যতা 5.0 প্রযোজ্য নয়
ধারাবাহিকতা 8.1 8.1
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 25.8% 27.3%
অস্থির টেস্ট 5 0
মোট রান 66 54
প্রতি ফলাফলে খরচ 1.187 1.570
মোট খরচ $0.036 $0.057
ইনপুট মূল্য $0.100 / 1M $1.250 / 1M
আউটপুট মূল্য $0.150 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 17,070 41,313
আউটপুট টোকেন 29,045 1,923
রিজনিং টোকেন 209,516 0
প্রতিক্রিয়া সময় (গড়) 82.24s 1.11s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 226.38s 6.04s
প্রতিক্রিয়া সময় (মোট) 1315.88s 19.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#220 Qwen3.5-9B

medium
খরচ
$0.001
সময়
35.9s
টোকেন
3,030 tok

#213 xAI: Grok 4.20

none
খরচ
$0.004
সময়
6.5s
টোকেন
1,367 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

দ্রুত তুলনা

তুলনার জুটি বদলান