AI BENCHY
Advertise here
#65

Gemma 4 26B A4B

Google প্রকাশ: 2026-04-03 পরীক্ষিত হয়েছে: 2026-04-22 21:39 google/gemma-4-26b-a4b-it::none
25.2B মোট (3.8B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

Gemma 4 26B A4B AI BENCHY-তে 6.2 স্কোর করে এবং #65 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 48.2%, মোট খরচ $0.005, এবং গড় response time 6.59s.

Gemma 4 26B A4B কে আলাদা করে যা: এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম। একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
25.2B মোট (3.8B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

8.7

নির্ভরযোগ্যতা

প্রযোজ্য নয়

মোট আউটপুট টোকেন

1,783

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.070 / 1M

আউটপুট মূল্য

$0.340 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 11

প্রতি চেষ্টায় পাস রেট: 48.2%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

6.59s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 57.10s

প্রতিক্রিয়া সময় (মোট): 118.61s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Gemma 4 26B A4B

none
খরচ
$0.001
সময়
39.5s
টোকেন
790 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:51 পুনরায় পরীক্ষা 5.6 10.0 $0.023 তুলনা করুন
2026-07-16 23:02 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.018 তুলনা করুন
2026-06-04 14:04 নতুন টেস্ট যোগ হয়েছে 6.0 10.0 $0.004 তুলনা করুন
2026-05-22 00:29 স্যুইট পরিবর্তিত হয়েছে 6.2 10.0 $0.006 তুলনা করুন
2026-04-22 21:39 প্রথম নথিভুক্ত রান 6.2 প্রযোজ্য নয় $0.005 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-04-22 21:39 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা6.28.7প্রযোজ্য নয়7/1831,7830$0.0056.59s
2026-05-22 00:29 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা6.29.210.08/2021,8150$0.0066.00s
পার্থক্য0.0-0.5-1+1-320-$0.001+591ms

বেঞ্চমার্ক কভারেজ আলাদা: 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.3 10.0
কোডিং 4.7 1.6
সমন্বিত 3.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.6 7.2
Sadharon Buddhimotta 4.0 10.0
নির্দেশনা অনুসরণ 4.4 6.9
ধাঁধা সমাধান 5.7 10.0
টুল কলিং 10.0 10.0

তুলনা করা মডেল