नेविगेशन
Advertise here

Mercury 2.5 vs Grok 4.20

Grok 4.20 average score में आगे है: 4.1 vs 3.9. Mercury 2.5 की benchmark लागत कम है: $0.016 vs $0.057. Grok 4.20 तेज है: 1.11s vs 2.45s, pass rates 25.8% vs 27.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#312
कुल आउटपुट टोकन
71,143
प्रतिक्रिया समय (औसत)
2.45s
कुल लागत
$0.016
रैंक
#304
कुल आउटपुट टोकन
1,923
प्रतिक्रिया समय (औसत)
1.11s
कुल लागत
$0.057
अनुशंसित मॉडल Grok 4.20

It has the best score here (4.1), while responding about 2.2x faster than Mercury 2.5.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 none रिलीज़: 2026-09-08 Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 3.9 4.1
रैंक #312 #304
विश्वसनीयता 10.0 लागू नहीं
संगति 7.5 8.1
प्रयास 66/66 54/66
सही परीक्षण
प्रति प्रयास पास दर 25.8% 27.3%
अस्थिर टेस्ट 7 0
कुल रन 66 54
प्रति परिणाम लागत 0.782 1.570
कुल लागत $0.016 $0.057
इनपुट कीमत $0.040 / 1M $1.250 / 1M
आउटपुट कीमत $0.150 / 1M $2.500 / 1M
कुल इनपुट टोकन 123,740 41,313
आउटपुट टोकन 71,143 1,923
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 2.45s 1.11s
प्रतिक्रिया समय (अधिकतम) 36.48s 6.04s
प्रतिक्रिया समय (कुल) 53.83s 19.96s
पैरामीटर ~100B ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#312 Mercury 2.5

none
लागत
$0.001
समय
2.7s
टोकन
2,749 tok

#304 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें