AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#61

Kimi K2.6

Moonshot AI रिलीज़: 2026-04-20 परीक्षण किया गया: 2026-06-04 13:59 moonshotai/kimi-k2.6::medium
(medium) (none)

सारांश

Kimi K2.6 AI BENCHY पर 7.2 स्कोर करता है और #61 पर है। इसकी reliability 7.8, pass rate 66.7%, कुल लागत $0.891, और औसत response time 71.67s है।

Kimi K2.6 को अलग क्या बनाता है: यह संयुक्त में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि कोडिंग इसकी सबसे कमजोर जगह है, जहाँ यह #18 पर है।

संगति

8.3

कुल लागत (वर्तमान कीमत)

$0.891 ↓ -11.2%

परीक्षण के समय: $1.003

कुल आउटपुट टोकन

357,017

कुल इनपुट टोकन

29,450

इनपुट कीमत

$0.684 / 1M

आउटपुट कीमत

$3.420 / 1M

सही परीक्षण

गलत टेस्ट: 9

प्रति प्रयास पास दर: 66.7%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

71.67s

प्रतिक्रिया समय (अधिकतम): 406.78s

प्रतिक्रिया समय (कुल): 1433.36s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#61 MoonshotAI: Kimi K2.6

medium
लागत
$0.013
समय
103.4s
टोकन
3,620 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-07-16 22:59 नया टेस्ट जोड़ा गया 7.2 9.4 $1.222 तुलना करें
2026-06-04 13:59 नया टेस्ट जोड़ा गया 7.2 7.8 $0.891 वर्तमान रन
2026-05-22 00:14 सूट बदला गया 7.4 8.3 $0.916 तुलना करें
2026-04-23 10:54 पहला दर्ज रन 7.7 लागू नहीं $0.722 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 14:42 $0.684 / 1M $3.420 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 7.0 8.0
कोडिंग 5.4 6.5
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 10.0 10.0
निर्देश पालन 10.0 10.0
पहेली समाधान 6.0 7.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल