AI BENCHY
Advertise here
#52

GLM 5.1

Z.ai প্রকাশ: 2026-04-07 পরীক্ষিত হয়েছে: 2026-05-21 23:46 z-ai/glm-5.1::medium
744B মোট (40B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

GLM 5.1 AI BENCHY-তে 7.4 স্কোর করে এবং #52 স্থানে আছে। এর reliability 3.3, pass rate 71.7%, মোট খরচ $0.286, এবং গড় response time 32.22s.

GLM 5.1 কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #3; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
744B মোট (40B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

8.3

মোট আউটপুট টোকেন

83,351

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.980 / 1M

আউটপুট মূল্য

$3.080 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 8

প্রতি চেষ্টায় পাস রেট: 71.7%

অস্থির টেস্ট

4

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

32.22s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 172.60s

প্রতিক্রিয়া সময় (মোট): 612.25s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#52 GLM 5.1

medium
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 01:58 পুনরায় পরীক্ষা 7.0 8.1 $1.053 তুলনা করুন
2026-07-16 21:29 নতুন টেস্ট যোগ হয়েছে 7.1 8.3 $0.535 তুলনা করুন
2026-06-04 13:06 নতুন টেস্ট যোগ হয়েছে 7.3 6.7 $0.292 তুলনা করুন
2026-05-21 23:46 স্যুইট পরিবর্তিত হয়েছে 7.4 3.3 $0.286 বর্তমান রান
2026-05-08 14:41 স্যুইট পরিবর্তিত হয়েছে 7.6 0.0 $0.209 তুলনা করুন
2026-05-08 14:41 স্যুইট পরিবর্তিত হয়েছে 7.6 0.0 $0.209 তুলনা করুন
2026-04-22 12:55 প্রথম নথিভুক্ত রান 7.8 প্রযোজ্য নয় $0.201 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-21 23:46 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা7.48.33.312/20483,3510$0.28632.22s
2026-07-16 21:29 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা7.18.48.313/224152,55282,623$0.53546.77s
পার্থক্য+0.3-0.1-5.0-10-69201-82623-$0.249-14546ms

বেঞ্চমার্ক কভারেজ আলাদা: 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 4.7 1.6
সমন্বিত 9.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 10.0 10.0
নির্দেশনা অনুসরণ 6.4 5.8
ধাঁধা সমাধান 8.2 7.2
টুল কলিং 3.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল