নেভিগেশন
AI BENCHY
Advertise here

Qwen3.7 Flash (low) vs Grok 4.20 (medium)

Qwen3.7 Flash (low) average score-এ এগিয়ে: 7.3 vs 7.1. Qwen3.7 Flash (low)-এর benchmark খরচ কম: $0.042 vs $0.777. Grok 4.20 (medium) দ্রুত: 29.47s vs 36.80s, pass rates 68.2% vs 63.6%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-01

র‍্যাঙ্ক
#80
মোট আউটপুট টোকেন
297,249
প্রতিক্রিয়া সময় (গড়)
36.80s
মোট খরচ
$0.042
র‍্যাঙ্ক
#90
মোট আউটপুট টোকেন
259,340
প্রতিক্রিয়া সময় (গড়)
29.47s
মোট খরচ
$0.777
প্রস্তাবিত মডেল Qwen3.7 Flash (low)

It has the best score here (7.3), while costing about 18.8x less than Grok 4.20 (medium).

বিস্তারিত তুলনা

মেট্রিক Qwen3.7 Flash Qwen3.7 Flash low প্রকাশ: 2026-07-28 Grok 4.20 Grok 4.20 medium প্রকাশ: 2026-03-31
স্কোর 7.3 7.1
র‍্যাঙ্ক #80 #90
নির্ভরযোগ্যতা 9.9 10.0
ধারাবাহিকতা 8.4 8.5
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 68.2% 63.6%
অস্থির টেস্ট 5 4
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.346 9.709
মোট খরচ $0.042 $0.777
ইনপুট মূল্য $0.030 / 1M $1.250 / 1M
আউটপুট মূল্য $0.130 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 92,182 102,791
আউটপুট টোকেন 14,287 5,363
রিজনিং টোকেন 282,962 253,977
প্রতিক্রিয়া সময় (গড়) 36.80s 29.47s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 394.54s 199.66s
প্রতিক্রিয়া সময় (মোট) 809.54s 648.35s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#80 Qwen3.7 Flash

low
অবৈধ SVG
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#90 xAI: Grok 4.20

medium
খরচ
$0.041
সময়
110.3s
টোকেন
16,336 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.7 Flash 6.7 7.8 55.6% 1 42.36s 7,893 428 56,419
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

দ্রুত তুলনা

তুলনার জুটি বদলান