नेविगेशन
AI BENCHY
Advertise here

Kimi K2.5 (medium) vs Grok 4.20 (medium)

average score लगभग बराबर है: 7.0 vs 7.0. Kimi K2.5 (medium) की benchmark लागत कम है: $0.607 vs $0.805. Grok 4.20 (medium) तेज है: 32.56s vs 98.19s, pass rates 63.6% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#122
कुल आउटपुट टोकन
220,942
प्रतिक्रिया समय (औसत)
98.19s
कुल लागत
$0.607
रैंक
#120
कुल आउटपुट टोकन
270,259
प्रतिक्रिया समय (औसत)
32.56s
कुल लागत
$0.805
अनुशंसित मॉडल Grok 4.20 (medium)

It has the best score here (7.0), while responding about 3.0x faster than Kimi K2.5 (medium).

विस्तृत तुलना

मेट्रिक Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27 Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31
स्कोर 7.0 7.0
रैंक #122 #120
विश्वसनीयता 10.0 10.0
संगति 7.0 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 63.6% 60.6%
अस्थिर टेस्ट 8 5
कुल रन 66 66
प्रति परिणाम लागत 4.849 10.365
कुल लागत $0.607 $0.805
इनपुट कीमत $0.571 / 1M $1.250 / 1M
आउटपुट कीमत $2.850 / 1M $2.500 / 1M
कुल इनपुट टोकन 118,496 102,986
आउटपुट टोकन 53,522 5,860
रीजनिंग टोकन 167,420 264,399
प्रतिक्रिया समय (औसत) 98.19s 32.56s
प्रतिक्रिया समय (अधिकतम) 281.00s 199.66s
प्रतिक्रिया समय (कुल) 1571.05s 716.36s
पैरामीटर 1T कुल (32B सक्रिय) ~1T कुल (~100B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 MoonshotAI: Kimi K2.5

medium
लागत
$0.030
समय
58.6s
टोकन
8,683 tok

#120 SpaceXAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

त्वरित तुलना

तुलना जोड़ी बदलें