AI BENCHY
Advertise here
#87

KAT-Coder-Pro V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-07-16 23:43 kwaipilot/kat-coder-pro-v2.5::none
~700B মোট (~72B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

KAT-Coder-Pro V2.5 AI BENCHY-তে 6.7 স্কোর করে এবং #87 স্থানে আছে। এর reliability 10.0, pass rate 68.2%, মোট খরচ $0.476, এবং গড় response time 25.56s.

KAT-Coder-Pro V2.5 কে আলাদা করে যা: এটি অ্যান্টি-এআই কৌশল-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #4; আর সমন্বিত এর দুর্বলতম ক্ষেত্র, rank #18.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~700B মোট (~72B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.4

মোট আউটপুট টোকেন

135,861

মোট ইনপুট টোকেন

98,499

ইনপুট মূল্য

$0.740 / 1M

আউটপুট মূল্য

$2.960 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 11

প্রতি চেষ্টায় পাস রেট: 68.2%

অস্থির টেস্ট

7

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

25.56s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 335.41s

প্রতিক্রিয়া সময় (মোট): 562.43s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#87 KAT-Coder-Pro V2.5

none
খরচ
$0.010
সময়
29.0s
টোকেন
3,439 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:23 পুনরায় পরীক্ষা 6.7 10.0 $0.487 তুলনা করুন
2026-07-16 23:43 নতুন টেস্ট যোগ হয়েছে 6.7 10.0 $0.476 বর্তমান রান
2026-07-14 11:05 প্রথম রান 6.8 10.0 $0.220 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-16 23:43 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা6.77.410.011/227135,86198,499$0.47625.56s
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা6.87.310.011/21763,33842,749$0.22010.81s
পার্থক্য-0.1+0.10.000+72523+55750+$0.256+14754ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-07-14 11:25 $0.740 / 1M $2.960 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.7 7.9
কোডিং 6.1 4.7
সমন্বিত 4.1 5.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.6 7.2
Sadharon Buddhimotta 4.8 3.2
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 8.2 7.2
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল