AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#110

KAT-Coder-Air V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-07-14 11:05 kwaipilot/kat-coder-air-v2.5::high
~35B মোট (~3B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

KAT-Coder-Air V2.5 AI BENCHY-তে 6.2 স্কোর করে এবং #110 স্থানে আছে। এর reliability 9.7, pass rate 46.0%, মোট খরচ $0.064, এবং গড় response time 11.02s.

KAT-Coder-Air V2.5 কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~35B মোট (~3B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.6

মোট আউটপুট টোকেন

95,667

মোট ইনপুট টোকেন

41,748

ইনপুট মূল্য

$0.150 / 1M

আউটপুট মূল্য

$0.600 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 46.0%

অস্থির টেস্ট

6

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

11.02s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 104.98s

প্রতিক্রিয়া সময় (মোট): 231.37s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#110 KAT-Coder-Air V2.5

high
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:22 পুনরায় পরীক্ষা 5.6 9.8 $0.077 তুলনা করুন
2026-07-16 23:35 নতুন টেস্ট যোগ হয়েছে 5.6 9.9 $0.077 তুলনা করুন
2026-07-14 11:05 প্রথম রান 6.2 9.7 $0.064 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা6.27.69.77/21695,66741,748$0.06411.02s
2026-07-16 23:35 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা5.67.79.97/226115,33150,470$0.07715.90s
পার্থক্য+0.6-0.1-0.200-19664-8722-$0.014-4879ms

বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-07-14 11:25 $0.150 / 1M $0.600 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 6.9 5.8
কোডিং 4.3 7.3
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 6.5 10.0
ডোমেইন-নির্দিষ্ট 2.9 7.2
Sadharon Buddhimotta 5.1 10.0
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 3.5 4.4
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল