नेविगेशन
Advertise here

Mercury 2.5 (high) vs Kimi K2.5 (medium)

Mercury 2.5 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.479. Mercury 2.5 (high) तेज है: 4.32s vs 98.19s, pass rates 62.1% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#138
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#147
कुल आउटपुट टोकन
220,942
प्रतिक्रिया समय (औसत)
98.19s
कुल लागत
$0.479
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 15.5x less than Kimi K2.5 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27
स्कोर 7.1 7.0
रैंक #138 #147
विश्वसनीयता 9.7 10.0
संगति 8.6 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 63.6%
अस्थिर टेस्ट 4 8
कुल रन 66 66
प्रति परिणाम लागत 0.259 4.849
कुल लागत $0.031 $0.479
इनपुट कीमत $0.040 / 1M $0.450 / 1M
आउटपुट कीमत $0.150 / 1M $2.250 / 1M
कुल इनपुट टोकन 120,068 118,496
आउटपुट टोकन 3,402 53,522
रीजनिंग टोकन 171,145 167,420
प्रतिक्रिया समय (औसत) 4.32s 98.19s
प्रतिक्रिया समय (अधिकतम) 23.63s 281.00s
प्रतिक्रिया समय (कुल) 95.06s 1571.05s
पैरामीटर ~100B 1T कुल (32B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#138 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#147 MoonshotAI: Kimi K2.5

medium
लागत
$0.030
समय
58.6s
टोकन
8,683 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

त्वरित तुलना

तुलना जोड़ी बदलें