नेविगेशन
AI BENCHY
Advertise here

Claude Opus 4.8 vs Kimi K2.6 (medium)

average score लगभग बराबर है: 7.3 vs 7.2. Claude Opus 4.8 की benchmark लागत कम है: $1.166 vs $1.247. Claude Opus 4.8 तेज है: 4.92s vs 115.89s, pass rates 63.6% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-29

रैंक
#106
कुल आउटपुट टोकन
16,797
प्रतिक्रिया समय (औसत)
4.92s
कुल लागत
$1.166
रैंक
#107
कुल आउटपुट टोकन
347,519
प्रतिक्रिया समय (औसत)
115.89s
कुल लागत
$1.247
अनुशंसित मॉडल Claude Opus 4.8

It has the best score here (7.3), while responding about 23.6x faster than Kimi K2.6 (medium).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 Kimi K2.6 Kimi K2.6 medium रिलीज़: 2026-04-20
स्कोर 7.3 7.2
रैंक #106 #107
विश्वसनीयता 10.0 10.0
संगति 9.2 8.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 63.6% 63.6%
अस्थिर टेस्ट 2 4
कुल रन 66 66
प्रति परिणाम लागत 8.969 10.029
कुल लागत $1.166 $1.247
इनपुट कीमत $5.000 / 1M $0.950 / 1M
आउटपुट कीमत $25.000 / 1M $4.000 / 1M
कुल इनपुट टोकन 149,203 68,913
आउटपुट टोकन 16,797 64,654
रीजनिंग टोकन 0 282,865
प्रतिक्रिया समय (औसत) 4.92s 115.89s
प्रतिक्रिया समय (अधिकतम) 35.03s 876.20s
प्रतिक्रिया समय (कुल) 108.24s 2433.66s
पैरामीटर ~5T कुल (~500B सक्रिय) 1T कुल (32B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#106 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#107 MoonshotAI: Kimi K2.6

medium
लागत
$0.013
समय
103.4s
टोकन
3,620 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189

त्वरित तुलना

तुलना जोड़ी बदलें