AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#75

Kimi K2.5

Moonshot AI प्रकाशन: 2026-01-27 चाचणी तारीख: 2026-06-04 13:43 moonshotai/kimi-k2.5::medium
1T एकूण (32B सक्रिय)MoEवेट्स उपलब्ध
(medium) (none)

सारांश

Kimi K2.5 AI BENCHY वर 6.8 स्कोर करते आणि #75 वर आहे. याची reliability 10.0, pass rate 68.3%, एकूण खर्च $0.328, आणि सरासरी response time 98.43s आहे.

Kimi K2.5 खास का आहे: हे संयुक्त मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #18.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
1T एकूण (32B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट्स उपलब्ध
परवाना
Modified MIT

सुसंगतता

6.9

एकूण खर्च (सध्याची किंमत)

$0.328 ↓ -11.5%

या किमतीवर चाचणी केली: $0.371

एकूण आउटपुट टोकन्स

206,126

एकूण इनपुट टोकन्स

34,312

इनपुट किंमत

$0.400 / 1M

आउटपुट किंमत

$1.900 / 1M

कॅश वाचण्याची किंमत

लागू नाही

कॅश लिहिण्याची किंमत

लागू नाही

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

बरोबर चाचण्या

चुकीच्या चाचण्या: 11

प्रति प्रयत्न पास दर: 68.3%

अस्थिर चाचण्या

8

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

98.43s

प्रतिसाद वेळ (कमाल): 281.00s

प्रतिसाद वेळ (एकूण): 1378.03s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 MoonshotAI: Kimi K2.5

medium
खर्च
$0.030
वेळ
58.6s
टोकन्स
8,683 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:00 पुन्हा चाचणी 7.0 10.0 $0.607 ↑ तुलना करा
2026-07-16 22:17 नवीन चाचणी जोडली 7.0 10.0 $0.600 ↑ तुलना करा
2026-06-04 13:43 नवीन चाचणी जोडली 6.8 10.0 $0.328 ↓ सध्याची रन
2026-05-22 00:12 सूट बदलला 6.7 10.0 $0.314 तुलना करा
2026-04-20 17:48 पहिली नोंदलेली रन 7.0 लागू नाही $0.220 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-06-04 13:43 · नवीन चाचणी जोडली63/63 प्रयत्न6.86.910.010/218206,12634,312$0.32898.43s
2026-04-20 17:48 · पहिली नोंदलेली रन54/54 प्रयत्न7.06.8लागू नाही9/187127,0460$0.22072.43s
फरक—-0.2+0.1+1+1+79080+34312+$0.108+26003ms

बेंचमार्क कव्हरेज वेगळे आहे: 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत कॅश वाचण्याची किंमत कॅश लिहिण्याची किंमत
2026-06-04 14:42 $0.400 / 1M $1.900 / 1M लागू नाही लागू नाही

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 7.3 5.8
कोडिंग 6.1 4.6
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.5 4.4
Samanya Buddhimatta 6.5 3.4
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 5.3 7.3
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स