AI BENCHY
Advertise here
#73

Kimi K2.5

Moonshot AI প্রকাশ: 2026-01-27 পরীক্ষিত হয়েছে: 2026-07-16 22:17 moonshotai/kimi-k2.5::medium
1T মোট (32B সক্রিয়)MoEওজন উপলভ্য
(medium) (none)

সারাংশ

Kimi K2.5 AI BENCHY-তে 7.0 স্কোর করে এবং #73 স্থানে আছে। এর reliability 10.0, pass rate 65.2%, মোট খরচ $0.600, এবং গড় response time 99.00s.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
1T মোট (32B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
ওজন উপলভ্য
লাইসেন্স
Modified MIT

ধারাবাহিকতা

7.0

মোট খরচ (বর্তমান মূল্য)

$0.600 ↑ +25.1%

পরীক্ষার সময়: $0.479

মোট আউটপুট টোকেন

227,367

মোট ইনপুট টোকেন

118,448

ইনপুট মূল্য

$0.571 / 1M

আউটপুট মূল্য

$2.850 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 12

প্রতি চেষ্টায় পাস রেট: 65.2%

অস্থির টেস্ট

8

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

99.00s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 281.00s

প্রতিক্রিয়া সময় (মোট): 1485.04s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#73 MoonshotAI: Kimi K2.5

medium
খরচ
$0.030
সময়
58.6s
টোকেন
8,683 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:00 পুনরায় পরীক্ষা 7.0 10.0 $0.607 তুলনা করুন
2026-07-16 22:17 নতুন টেস্ট যোগ হয়েছে 7.0 10.0 $0.600 বর্তমান রান
2026-06-04 13:43 নতুন টেস্ট যোগ হয়েছে 6.8 10.0 $0.328 তুলনা করুন
2026-05-22 00:12 স্যুইট পরিবর্তিত হয়েছে 6.7 10.0 $0.314 তুলনা করুন
2026-04-20 17:48 প্রথম নথিভুক্ত রান 7.0 প্রযোজ্য নয় $0.220 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-16 22:17 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা7.07.010.010/228227,367118,448$0.60099.00s
2026-05-22 00:12 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা6.76.810.09/208174,8030$0.31489.36s
পার্থক্য+0.3+0.20.0+10+52564+118448+$0.286+9645ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-04 15:40 $0.400 / 1M $1.900 / 1M
2026-06-17 10:07 $0.375 / 1M $2.025 / 1M
2026-07-16 15:36 $0.571 / 1M $2.850 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 7.3 5.8
কোডিং 6.1 4.6
সমন্বিত 6.7 9.1
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.5 4.4
Sadharon Buddhimotta 6.5 3.4
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 5.3 7.3
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল