AI BENCHY
Advertise here
#35

GLM 5V Turbo

Z.ai প্রকাশ: 2026-04-01 পরীক্ষিত হয়েছে: 2026-04-11 01:19 z-ai/glm-5v-turbo::medium
~106B মোট (~12B সক্রিয়)MoEবন্ধ উৎসআনুমানিক
(medium) (none)

সারাংশ

GLM 5V Turbo AI BENCHY-তে 7.8 স্কোর করে এবং #35 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 77.8%, মোট খরচ $0.291, এবং গড় response time 14.96s.

GLM 5V Turbo কে আলাদা করে যা: এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

আর্কাইভড মডেল: এই মডেল আর আপডেট করা হবে না এবং নতুন টেস্টে পরীক্ষা করা হবে না।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~106B মোট (~12B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.5

নির্ভরযোগ্যতা

প্রযোজ্য নয়

মোট আউটপুট টোকেন

61,292

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$1.200 / 1M

আউটপুট মূল্য

$4.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 7

প্রতি চেষ্টায় পাস রেট: 77.8%

অস্থির টেস্ট

6

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

14.96s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 67.08s

প্রতিক্রিয়া সময় (মোট): 269.32s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#35 GLM 5V Turbo

medium
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-06-04 13:09 পুনরায় পরীক্ষা 6.7 10.0 $0.457 তুলনা করুন
2026-06-04 13:09 পুনরায় পরীক্ষা 6.7 10.0 $0.457 তুলনা করুন
2026-06-04 13:09 নতুন টেস্ট যোগ হয়েছে 7.2 10.0 $0.457 তুলনা করুন
2026-05-21 23:44 স্যুইট পরিবর্তিত হয়েছে 7.4 10.0 $0.412 তুলনা করুন
2026-04-11 01:19 প্রথম নথিভুক্ত রান 7.8 প্রযোজ্য নয় $0.291 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-04-11 01:19 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা7.87.5প্রযোজ্য নয়11/18661,2920$0.29114.96s
2026-06-04 13:09 · পুনরায় পরীক্ষা63/63 প্রচেষ্টা6.77.510.011/216100,76244,615$0.45723.08s
পার্থক্য+1.10.000-39470-44615-$0.166-8115ms

বেঞ্চমার্ক কভারেজ আলাদা: 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 7.2 6.1
কোডিং 10.0 10.0
সমন্বিত 6.9 3.8
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 7.2
Sadharon Buddhimotta 10.0 10.0
নির্দেশনা অনুসরণ 9.9 10.0
ধাঁধা সমাধান 7.7 7.3
টুল কলিং 7.0 3.7

তুলনা করা মডেল