नेविगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs Kimi K2.5 (medium)

average score लगभग बराबर है: 7.0 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $0.607. Mercury 2 (medium) तेज है: 2.95s vs 98.19s, pass rates 53.0% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#119
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
रैंक
#122
कुल आउटपुट टोकन
220,942
प्रतिक्रिया समय (औसत)
98.19s
कुल लागत
$0.607
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (7.0), while costing about 6.5x less than Kimi K2.5 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27
स्कोर 7.0 7.0
रैंक #119 #122
विश्वसनीयता 10.0 10.0
संगति 8.4 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 53.0% 63.6%
अस्थिर टेस्ट 4 8
कुल रन 66 66
प्रति परिणाम लागत 0.933 4.849
कुल लागत $0.094 $0.607
इनपुट कीमत $0.250 / 1M $0.571 / 1M
आउटपुट कीमत $0.750 / 1M $2.850 / 1M
कुल इनपुट टोकन 110,515 118,496
आउटपुट टोकन 10,325 53,522
रीजनिंग टोकन 77,229 167,420
प्रतिक्रिया समय (औसत) 2.95s 98.19s
प्रतिक्रिया समय (अधिकतम) 14.63s 281.00s
प्रतिक्रिया समय (कुल) 61.89s 1571.05s
पैरामीटर ~100B 1T कुल (32B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#119 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#122 MoonshotAI: Kimi K2.5

medium
लागत
$0.030
समय
58.6s
टोकन
8,683 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

त्वरित तुलना

तुलना जोड़ी बदलें