नेविगेशन
Advertise here

Mercury 2.5 (high) vs Grok 4.20 (medium)

Mercury 2.5 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.805. Mercury 2.5 (high) तेज है: 4.32s vs 32.56s, pass rates 62.1% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#134
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#141
कुल आउटपुट टोकन
270,259
प्रतिक्रिया समय (औसत)
32.56s
कुल लागत
$0.805
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 26.0x less than Grok 4.20 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31
स्कोर 7.1 7.0
रैंक #134 #141
विश्वसनीयता 9.7 10.0
संगति 8.6 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 60.6%
अस्थिर टेस्ट 4 5
कुल रन 66 66
प्रति परिणाम लागत 0.259 10.365
कुल लागत $0.031 $0.805
इनपुट कीमत $0.040 / 1M $1.250 / 1M
आउटपुट कीमत $0.150 / 1M $2.500 / 1M
कुल इनपुट टोकन 120,068 102,986
आउटपुट टोकन 3,402 5,860
रीजनिंग टोकन 171,145 264,399
प्रतिक्रिया समय (औसत) 4.32s 32.56s
प्रतिक्रिया समय (अधिकतम) 23.63s 199.66s
प्रतिक्रिया समय (कुल) 95.06s 716.36s
पैरामीटर ~100B ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#141 SpaceXAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

त्वरित तुलना

तुलना जोड़ी बदलें