AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#208

Kimi K2.5

Moonshot AI प्रकाशन: 2026-01-27 चाचणी तारीख: 2026-10-01 01:36 moonshotai/kimi-k2.5::medium
1T एकूण (32B सक्रिय)MoEवेट्स उपलब्ध
(medium) (none)

सारांश

Kimi K2.5 AI BENCHY वर 6.4 स्कोर करते आणि #208 वर आहे. याची reliability 9.6, pass rate 60.9%, एकूण खर्च $0.841, आणि सरासरी response time 125.76s आहे.

Kimi K2.5 खास का आहे: हे सूचनांचे पालन मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर डोमेन-विशिष्ट हा सर्वात कमकुवत भाग आहे, rank #15.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
1T एकूण (32B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट्स उपलब्ध
परवाना
Modified MIT

सुसंगतता

7.1

एकूण खर्च (सध्याची किंमत)

$0.841 ↑ +38.2%

या किमतीवर चाचणी केली: $0.609

एकूण आउटपुट टोकन्स

241,096

एकूण इनपुट टोकन्स

292,271

इनपुट किंमत

$0.450 / 1M

आउटपुट किंमत

$2.250 / 1M

कॅश वाचण्याची किंमत

$0.070 / 1M

कॅश लिहिण्याची किंमत

लागू नाही

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 60.9%

अस्थिर चाचण्या

8

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

125.76s

प्रतिसाद वेळ (कमाल): 566.79s

प्रतिसाद वेळ (एकूण): 2137.84s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 MoonshotAI: Kimi K2.5

medium
खर्च
$0.030
वेळ
58.6s
टोकन्स
8,683 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-10-01 01:36 पुन्हा चाचणी 6.4 9.6 $0.841 ↑ सध्याची रन
2026-07-16 22:17 नवीन चाचणी जोडली 7.0 10.0 $0.600 ↑ तुलना करा
2026-06-04 13:43 नवीन चाचणी जोडली 6.8 10.0 $0.328 ↓ तुलना करा
2026-05-22 00:12 सूट बदलला 6.7 10.0 $0.314 तुलना करा
2026-04-20 17:48 पहिली नोंदलेली रन 7.0 लागू नाही $0.220 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-10-01 01:36 · सध्याची रन69/69 प्रयत्न6.47.19.610/238241,096292,271$0.841125.76s
2026-07-16 22:17 · नवीन चाचणी जोडली66/66 प्रयत्न7.07.010.010/228227,367118,448$0.60099.00s
फरक—-0.6+0.1-0.400+13729+173823+$0.242+26753ms

बेंचमार्क कव्हरेज वेगळे आहे: 69/69 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत कॅश वाचण्याची किंमत कॅश लिहिण्याची किंमत
2026-06-04 15:40 $0.400 / 1M $1.900 / 1M लागू नाही लागू नाही
2026-06-17 10:07 $0.375 / 1M $2.025 / 1M लागू नाही लागू नाही
2026-08-14 12:51 $0.571 / 1M $2.850 / 1M लागू नाही लागू नाही
2026-10-01 18:33 $0.450 / 1M $2.250 / 1M $0.070 / 1M लागू नाही

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
स्वायत्त एजंट कार्ये 3.9 9.6
अँटी-एआय युक्त्या 7.3 5.8
कोडिंग 6.1 4.6
संयुक्त 6.7 9.1
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 4.4
Samanya Buddhimatta 6.5 3.4
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 5.3 7.3
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स