AI BENCHY
Advertise here
#215

KAT-Coder-Air V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-08-14 03:26 kwaipilot/kat-coder-air-v2.5::medium
~35B মোট (~3B সক্রিয়)MoEবন্ধ উৎসআনুমানিক
(high) (medium) (low) (none)

সারাংশ

KAT-Coder-Air V2.5 AI BENCHY-তে 5.6 স্কোর করে এবং #215 স্থানে আছে। এর reliability 9.6, pass rate 45.5%, মোট খরচ $0.048, এবং গড় response time 8.65s.

KAT-Coder-Air V2.5 কে আলাদা করে যা: এটি অ্যান্টি-এআই কৌশল-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #9.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~35B মোট (~3B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

8.9

মোট আউটপুট টোকেন

66,576

মোট ইনপুট টোকেন

51,369

ইনপুট মূল্য

$0.150 / 1M

আউটপুট মূল্য

$0.600 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 45.5%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

8.65s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 48.19s

প্রতিক্রিয়া সময় (মোট): 190.35s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#215 KAT-Coder-Air V2.5

medium
খরচ
$0.003
সময়
23.7s
টোকেন
4,924 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:26 পুনরায় পরীক্ষা 5.6 9.6 $0.048 বর্তমান রান
2026-07-16 23:34 নতুন টেস্ট যোগ হয়েছে 5.6 9.9 $0.048 তুলনা করুন
2026-07-14 11:05 প্রথম রান 6.2 9.7 $0.045 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-08-14 03:26 · বর্তমান রান66/66 প্রচেষ্টা5.68.99.68/22366,57651,369$0.0488.65s
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা6.28.89.78/21364,11642,750$0.0458.28s
পার্থক্য-0.6+0.1-0.100+2460+8619+$0.003+376ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-08-14 12:51 $0.150 / 1M $0.600 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.7 8.0
কোডিং 3.6 7.0
সমন্বিত 6.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 6.5 10.0
ডোমেইন-নির্দিষ্ট 3.0 10.0
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 3.6 7.2
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল