নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

তুলনা করা মডেল

Grok 4.20 (medium) vs Grok 4.20 Beta (medium) vs Grok 4.3 (medium) benchmark তুলনা: Grok 4.3 (medium) স্কোর-এ 7.1 নিয়ে এগিয়ে। Grok 4.20 (medium) নির্ভরযোগ্যতা-এ 10.0 নিয়ে এগিয়ে। Grok 4.20 Beta (medium)-এর মোট খরচ সবচেয়ে কম, $0.750. Grok 4.20 Beta (medium) 9.75s-এ সবচেয়ে দ্রুত।

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-01

র‍্যাঙ্ক
#90
মোট আউটপুট টোকেন
259,340
প্রতিক্রিয়া সময় (গড়)
29.47s
মোট খরচ
$0.777
র‍্যাঙ্ক
#152
মোট আউটপুট টোকেন
93,212
প্রতিক্রিয়া সময় (গড়)
9.75s
মোট খরচ
$0.750
র‍্যাঙ্ক
#88
মোট আউটপুট টোকেন
241,421
প্রতিক্রিয়া সময় (গড়)
47.45s
মোট খরচ
$0.779
প্রস্তাবিত মডেল Grok 4.20 (medium)

It has the strongest score in this comparison (7.1) and the best overall balance of cost and response time across all 3 models.

বিস্তারিত তুলনা

মেট্রিক Grok 4.20 Grok 4.20 medium প্রকাশ: 2026-03-31 Grok 4.20 Beta Grok 4.20 Beta medium প্রকাশ: 2026-03-12 Grok 4.3 Grok 4.3 medium প্রকাশ: 2026-05-01
স্কোর 7.1 6.0 7.1
র‍্যাঙ্ক #90 #152 #88
নির্ভরযোগ্যতা 10.0 প্রযোজ্য নয় 10.0
ধারাবাহিকতা 8.5 7.8 8.6
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 63.6% 66.7% 68.2%
অস্থির টেস্ট 4 1 4
মোট রান 66 52 66
প্রতি ফলাফলে খরচ 9.709 4.505 5.990
মোট খরচ $0.777 $0.750 $0.779
ইনপুট মূল্য $1.250 / 1M $5.805 / 1M $1.250 / 1M
আউটপুট মূল্য $2.500 / 1M $5.805 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 102,791 35,955 140,031
আউটপুট টোকেন 5,363 1,647 13,739
রিজনিং টোকেন 253,977 91,565 227,682
প্রতিক্রিয়া সময় (গড়) 29.47s 9.75s 47.45s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 199.66s 31.36s 216.69s
প্রতিক্রিয়া সময় (মোট) 648.35s 175.48s 1043.83s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#90 xAI: Grok 4.20

medium
খরচ
$0.041
সময়
110.3s
টোকেন
16,336 tok

#152 Grok 4.20 Beta

medium
খরচ
$0.034
সময়
91.0s
টোকেন
13,523 tok

#88 xAI: Grok 4.3

medium
খরচ
$0.009
সময়
19.0s
টোকেন
3,661 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

দ্রুত তুলনা

তুলনার জুটি বদলান