Advertise here
#29

GLM 5 Turbo

Z.ai প্রকাশ: 2026-03-15 পরীক্ষিত হয়েছে: 2026-05-21 23:44 z-ai/glm-5-turbo::medium
744B মোট (40B সক্রিয়)MoEবন্ধ উৎস
(medium) (none)

সারাংশ

GLM 5 Turbo AI BENCHY-তে 7.9 স্কোর করে এবং #29 স্থানে আছে। এর reliability 8.3, pass rate 76.7%, মোট খরচ $0.244, এবং গড় response time 22.69s.

GLM 5 Turbo কে আলাদা করে যা: এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

আর্কাইভড মডেল: এই মডেল আর আপডেট করা হবে না এবং নতুন টেস্টে পরীক্ষা করা হবে না।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
744B মোট (40B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

ধারাবাহিকতা

8.1

মোট আউটপুট টোকেন

65,789

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$1.200 / 1M

আউটপুট মূল্য

$4.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 7

প্রতি চেষ্টায় পাস রেট: 76.7%

অস্থির টেস্ট

5

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

22.69s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 194.23s

প্রতিক্রিয়া সময় (মোট): 453.72s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GLM 5 Turbo

medium
খরচ
$0.074
সময়
206.0s
টোকেন
18,549 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-06-04 13:06 পুনরায় পরীক্ষা 7.6 10.0 $0.323 তুলনা করুন
2026-06-04 13:06 পুনরায় পরীক্ষা 7.6 10.0 $0.323 তুলনা করুন
2026-06-04 13:06 নতুন টেস্ট যোগ হয়েছে 8.0 10.0 $0.323 তুলনা করুন
2026-05-21 23:44 স্যুইট পরিবর্তিত হয়েছে 7.9 8.3 $0.244 বর্তমান রান
2026-04-11 01:19 প্রথম নথিভুক্ত রান 8.1 প্রযোজ্য নয় $0.182 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-21 23:44 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা7.98.18.313/20565,7890$0.24422.69s
2026-06-04 13:06 · পুনরায় পরীক্ষা63/63 প্রচেষ্টা7.68.110.014/21474,52235,593$0.32323.00s
পার্থক্য+0.30.0-1.7-1+1-8733-35593-$0.080-312ms

বেঞ্চমার্ক কভারেজ আলাদা: 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 7.3 5.8
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 2.9 4.4
Sadharon Buddhimotta 6.1 3.1
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 8.7 7.9
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল