AI BENCHY
Advertise here
#111

Kimi K2.6

Moonshot AI प्रकाशन: 2026-04-20 चाचणी तारीख: 2026-05-22 00:18 moonshotai/kimi-k2.6::none
1T एकूण (32B सक्रिय)MoEवेट्स उपलब्ध
(medium) (none)

सारांश

Kimi K2.6 AI BENCHY वर 5.6 स्कोर करते आणि #111 वर आहे. याची reliability 8.3, pass rate 38.3%, एकूण खर्च $0.088, आणि सरासरी response time 13.86s आहे.

Kimi K2.6 खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #3 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
1T एकूण (32B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट्स उपलब्ध
परवाना
Modified MIT

सुसंगतता

9.2

एकूण आउटपुट टोकन्स

16,563

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.730 / 1M

आउटपुट किंमत

$3.490 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 38.3%

अस्थिर चाचण्या

2

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

13.86s

प्रतिसाद वेळ (कमाल): 238.89s

प्रतिसाद वेळ (एकूण): 277.18s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 MoonshotAI: Kimi K2.6

none
खर्च
$0.020
वेळ
127.4s
टोकन्स
4,429 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:58 पुन्हा चाचणी 5.7 10.0 $0.233 तुलना करा
2026-07-16 22:20 नवीन चाचणी जोडली 5.8 10.0 $0.233 तुलना करा
2026-06-04 13:36 नवीन चाचणी जोडली 5.5 10.0 $0.079 तुलना करा
2026-05-22 00:18 सूट बदलला 5.6 8.3 $0.088 सध्याची रन
2026-04-23 10:54 पहिली नोंदलेली रन 5.8 लागू नाही $0.038 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:18 · सूट बदलला60/60 प्रयत्न5.69.28.37/20216,5630$0.08813.86s
2026-08-14 01:58 · पुन्हा चाचणी66/66 प्रयत्न5.79.310.06/22230,249116,983$0.23319.57s
फरक-0.1-0.1-1.7+10-13686-116983-$0.145-5713ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 4.6 10.0
कोडिंग 6.8 9.8
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 5.4 3.5
सूचनांचे पालन 6.5 10.0
कोडी सोडवणे 3.2 9.8
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स