AI BENCHY
Advertise here
#101

KAT-Coder-Pro V2.5

Kwaipilot প্রকাশ: 2026-07-14 পরীক্ষিত হয়েছে: 2026-08-14 03:23 kwaipilot/kat-coder-pro-v2.5::low
~700B মোট (~72B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

KAT-Coder-Pro V2.5 AI BENCHY-তে 7.3 স্কোর করে এবং #101 স্থানে আছে। এর reliability 10.0, pass rate 68.2%, মোট খরচ $0.400, এবং গড় response time 20.20s.

KAT-Coder-Pro V2.5 কে আলাদা করে যা: এটি নির্দেশনা অনুসরণ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর Sadharon Buddhimotta এর দুর্বলতম ক্ষেত্র, rank #17.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~700B মোট (~72B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

7.0

মোট আউটপুট টোকেন

113,193

মোট ইনপুট টোকেন

87,682

ইনপুট মূল্য

$0.740 / 1M

আউটপুট মূল্য

$2.960 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 11

প্রতি চেষ্টায় পাস রেট: 68.2%

অস্থির টেস্ট

8

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

20.20s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 209.15s

প্রতিক্রিয়া সময় (মোট): 444.35s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#101 KAT-Coder-Pro V2.5

low
খরচ
$0.016
সময়
47.6s
টোকেন
5,182 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:23 পুনরায় পরীক্ষা 7.3 10.0 $0.400 বর্তমান রান
2026-07-16 23:38 নতুন টেস্ট যোগ হয়েছে 7.4 10.0 $0.387 তুলনা করুন
2026-07-14 11:05 প্রথম রান 8.0 9.9 $0.220 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-08-14 03:23 · বর্তমান রান66/66 প্রচেষ্টা7.37.010.011/228113,19387,682$0.40020.20s
2026-07-14 11:05 · প্রথম রান63/63 প্রচেষ্টা8.07.39.911/21763,30042,750$0.22010.44s
পার্থক্য-0.6-0.3+0.10+1+49893+44932+$0.181+9761ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-08-14 12:51 $0.740 / 1M $2.960 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 6.9 5.8
কোডিং 7.8 10.0
সমন্বিত 6.4 5.8
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.5 4.4
Sadharon Buddhimotta 4.1 2.7
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 6.4 4.4
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল