নেভিগেশন
AI BENCHY
Advertise here

Qwen3.7 Plus vs Grok 4.20 (medium)

average score প্রায় সমান: 7.2 vs 7.1. Qwen3.7 Plus-এর benchmark খরচ কম: $0.106 vs $0.777. Qwen3.7 Plus দ্রুত: 12.09s vs 29.47s, pass rates 50.0% vs 63.6%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-28

র‍্যাঙ্ক
#81
মোট আউটপুট টোকেন
58,097
প্রতিক্রিয়া সময় (গড়)
12.09s
মোট খরচ
$0.106
র‍্যাঙ্ক
#85
মোট আউটপুট টোকেন
259,340
প্রতিক্রিয়া সময় (গড়)
29.47s
মোট খরচ
$0.777
প্রস্তাবিত মডেল Qwen3.7 Plus

It has the best score here (7.2), while costing about 7.3x less than Grok 4.20 (medium).

বিস্তারিত তুলনা

মেট্রিক Qwen3.7 Plus Qwen3.7 Plus none প্রকাশ: 2026-06-03 Grok 4.20 Grok 4.20 medium প্রকাশ: 2026-03-31
স্কোর 7.2 7.1
র‍্যাঙ্ক #81 #85
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 10.0 8.5
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 50.0% 63.6%
অস্থির টেস্ট 0 4
মোট রান 66 66
প্রতি ফলাফলে খরচ 1.014 9.709
মোট খরচ $0.106 $0.777
ইনপুট মূল্য $0.320 / 1M $1.250 / 1M
আউটপুট মূল্য $1.280 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 98,824 102,791
আউটপুট টোকেন 58,097 5,363
রিজনিং টোকেন 0 253,977
প্রতিক্রিয়া সময় (গড়) 12.09s 29.47s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 206.03s 199.66s
প্রতিক্রিয়া সময় (মোট) 265.89s 648.35s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#81 Qwen3.7 Plus

none
খরচ
$0.019
সময়
213.5s
টোকেন
11,960 tok

#85 xAI: Grok 4.20

medium
খরচ
$0.041
সময়
110.3s
টোকেন
16,336 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Qwen3.7 Plus 5.5 10.0 33.3% 0 2.15s 7,911 639 0
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

দ্রুত তুলনা

তুলনার জুটি বদলান