AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#124

KAT-Coder-Air V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-07-14 11:05 kwaipilot/kat-coder-air-v2.5::low
~35B মোট (~3B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

KAT-Coder-Air V2.5 AI BENCHY-তে 6.0 স্কোর করে এবং #124 স্থানে আছে। এর reliability 9.7, pass rate 46.0%, মোট খরচ $0.030, এবং গড় response time 6.47s.

KAT-Coder-Air V2.5 কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~35B মোট (~3B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.6

মোট আউটপুট টোকেন

39,091

মোট ইনপুট টোকেন

42,464

ইনপুট মূল্য

$0.150 / 1M

আউটপুট মূল্য

$0.600 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 46.0%

অস্থির টেস্ট

6

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

6.47s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 25.49s

প্রতিক্রিয়া সময় (মোট): 135.80s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#124 KAT-Coder-Air V2.5

low
খরচ
$0.004
সময়
29.9s
টোকেন
6,008 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:16 পুনরায় পরীক্ষা 5.4 9.9 $0.046 তুলনা করুন
2026-07-16 23:32 নতুন টেস্ট যোগ হয়েছে 5.4 9.9 $0.041 তুলনা করুন
2026-07-14 11:05 প্রথম রান 6.0 9.7 $0.030 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা6.07.69.77/21639,09142,464$0.0306.47s
2026-07-16 23:32 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা5.47.49.97/22752,89561,085$0.04110.09s
পার্থক্য+0.6+0.2-0.20-1-13804-18621-$0.012-3626ms

বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-07-14 11:25 $0.150 / 1M $0.600 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 7.3 5.8
কোডিং 3.5 7.3
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 6.5 10.0
ডোমেইন-নির্দিষ্ট 2.9 7.2
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 3.1 4.6
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল