AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#115

KAT-Coder-Air V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-07-14 11:05 kwaipilot/kat-coder-air-v2.5::medium
~35B মোট (~3B সক্রিয়)MoEবন্ধ উৎসআনুমানিক
(high) (medium) (low) (none)

সারাংশ

KAT-Coder-Air V2.5 AI BENCHY-তে 6.2 স্কোর করে এবং #115 স্থানে আছে। এর reliability 9.7, pass rate 47.6%, মোট খরচ $0.045, এবং গড় response time 8.28s.

KAT-Coder-Air V2.5 কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~35B মোট (~3B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

8.8

মোট আউটপুট টোকেন

64,116

মোট ইনপুট টোকেন

42,750

ইনপুট মূল্য

$0.150 / 1M

আউটপুট মূল্য

$0.600 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 13

প্রতি চেষ্টায় পাস রেট: 47.6%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

8.28s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 48.19s

প্রতিক্রিয়া সময় (মোট): 173.80s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#115 KAT-Coder-Air V2.5

medium
খরচ
$0.003
সময়
23.7s
টোকেন
4,924 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:26 পুনরায় পরীক্ষা 5.6 9.6 $0.048 তুলনা করুন
2026-07-16 23:34 নতুন টেস্ট যোগ হয়েছে 5.6 9.9 $0.048 তুলনা করুন
2026-07-14 11:05 প্রথম রান 6.2 9.7 $0.045 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা6.28.89.78/21364,11642,750$0.0458.28s
2026-08-14 03:26 · পুনরায় পরীক্ষা66/66 প্রচেষ্টা5.68.99.68/22366,57651,369$0.0488.65s
পার্থক্য+0.6-0.1+0.100-2460-8619-$0.003-376ms

বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-07-14 11:25 $0.150 / 1M $0.600 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.7 8.0
কোডিং 3.6 7.0
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 6.5 10.0
ডোমেইন-নির্দিষ্ট 3.0 10.0
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 3.6 7.2
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল