AI BENCHY
Advertise here
#52

Grok 4.20

X AI প্রকাশ: 2026-03-31 পরীক্ষিত হয়েছে: 2026-04-11 01:44 x-ai/grok-4.20::medium
~1T মোট (~100B সক্রিয়)MoEবন্ধ উৎসআনুমানিক
(medium) (none)

সারাংশ

Grok 4.20 AI BENCHY-তে 7.0 স্কোর করে এবং #52 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 66.7%, মোট খরচ $0.743, এবং গড় response time 10.33s.

Grok 4.20 কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18. একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

পরিচয় নোট

Grok 4.20 Beta ছিল Grok 4.20-এর প্রিভিউ সংস্করণ।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~1T মোট (~100B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.8

নির্ভরযোগ্যতা

প্রযোজ্য নয়

মোট আউটপুট টোকেন

111,626

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$2.000 / 1M

আউটপুট মূল্য

$6.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 9

প্রতি চেষ্টায় পাস রেট: 66.7%

অস্থির টেস্ট

5

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

10.33s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 29.87s

প্রতিক্রিয়া সময় (মোট): 185.87s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#52 xAI: Grok 4.20

medium
খরচ
$0.041
সময়
110.3s
টোকেন
16,336 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:57 পুনরায় পরীক্ষা 7.0 10.0 $0.805 তুলনা করুন
2026-07-16 23:07 নতুন টেস্ট যোগ হয়েছে 7.1 10.0 $0.777 তুলনা করুন
2026-06-04 14:17 নতুন টেস্ট যোগ হয়েছে 7.1 10.0 $0.609 তুলনা করুন
2026-05-22 00:32 স্যুইট পরিবর্তিত হয়েছে 6.7 10.0 $0.832 তুলনা করুন
2026-05-08 15:32 স্যুইট পরিবর্তিত হয়েছে 6.9 10.0 $0.756 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 7.0 প্রযোজ্য নয় $0.743 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-04-11 01:44 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা7.07.8প্রযোজ্য নয়9/185111,6260$0.74310.33s
2026-05-22 00:32 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা6.78.010.010/205158,1050$0.83219.09s
পার্থক্য+0.3-0.2-10-464790-$0.089-8767ms

বেঞ্চমার্ক কভারেজ আলাদা: 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.2 7.9
কোডিং 4.3 1.1
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 5.8 2.8
নির্দেশনা অনুসরণ 7.3 5.9
ধাঁধা সমাধান 6.4 7.7
টুল কলিং 3.0 10.0

তুলনা করা মডেল