AI BENCHY
Advertise here
#202

GLM 5.1

Z.ai প্রকাশ: 2026-04-07 পরীক্ষিত হয়েছে: 2026-08-14 01:32 z-ai/glm-5.1::none
744B মোট (40B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

GLM 5.1 AI BENCHY-তে 5.7 স্কোর করে এবং #202 স্থানে আছে। এর reliability 10.0, pass rate 45.5%, মোট খরচ $0.164, এবং গড় response time 6.74s.

GLM 5.1 কে আলাদা করে যা: এটি ধাঁধা সমাধান-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #2; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #12.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
744B মোট (40B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

8.2

মোট খরচ (বর্তমান মূল্য)

$0.164 ↓ -1.3%

পরীক্ষার সময়: $0.166

মোট আউটপুট টোকেন

14,393

মোট ইনপুট টোকেন

124,219

ইনপুট মূল্য

$0.966 / 1M

আউটপুট মূল্য

$3.036 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 45.5%

অস্থির টেস্ট

5

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

6.74s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 61.20s

প্রতিক্রিয়া সময় (মোট): 148.20s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 GLM 5.1

none
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 01:32 পুনরায় পরীক্ষা 5.7 10.0 $0.238 বর্তমান রান
2026-07-16 21:16 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.164 তুলনা করুন
2026-06-04 13:04 নতুন টেস্ট যোগ হয়েছে 5.7 10.0 $0.058 তুলনা করুন
2026-05-21 23:41 স্যুইট পরিবর্তিত হয়েছে 5.6 10.0 $0.057 তুলনা করুন
2026-05-08 13:04 স্যুইট পরিবর্তিত হয়েছে 5.7 10.0 $0.053 তুলনা করুন
2026-05-08 13:04 স্যুইট পরিবর্তিত হয়েছে 5.7 10.0 $0.053 তুলনা করুন
2026-04-22 12:55 প্রথম নথিভুক্ত রান 5.6 প্রযোজ্য নয় $0.053 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-08-14 01:32 · বর্তমান রান66/66 প্রচেষ্টা5.78.210.08/22514,393124,219$0.1646.74s
2026-06-04 13:04 · নতুন টেস্ট যোগ হয়েছে63/63 প্রচেষ্টা5.78.510.07/2143,75447,133$0.0584.10s
পার্থক্য0.0-0.30.0+1+1+10639+77086+$0.106+2632ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-04 15:40 $0.980 / 1M $3.080 / 1M
2026-06-30 21:25 $0.975 / 1M $4.301 / 1M
2026-08-05 23:12 $0.952 / 1M $2.992 / 1M
2026-08-14 12:51 $1.400 / 1M $4.400 / 1M
2026-08-15 12:46 $0.966 / 1M $3.036 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 4.0 6.3
কোডিং 3.9 9.7
সমন্বিত 2.8 1.8
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 7.2
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 7.7 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল