नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 vs Grok 4.20

Mercury 2 average score में आगे है: 4.7 vs 4.1. Mercury 2 की benchmark लागत कम है: $0.030 vs $0.057. Mercury 2 तेज है: 825ms vs 1.11s, pass rates 24.2% vs 27.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#259
कुल आउटपुट टोकन
9,584
प्रतिक्रिया समय (औसत)
825ms
कुल लागत
$0.030
रैंक
#269
कुल आउटपुट टोकन
1,923
प्रतिक्रिया समय (औसत)
1.11s
कुल लागत
$0.057
अनुशंसित मॉडल Mercury 2

It has the best score here (4.7), while costing about 1.9x less than Grok 4.20.

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 4.7 4.1
रैंक #259 #269
विश्वसनीयता 10.0 लागू नहीं
संगति 9.2 8.1
प्रयास 66/66 54/66
सही परीक्षण
प्रति प्रयास पास दर 24.2% 27.3%
अस्थिर टेस्ट 2 0
कुल रन 66 54
प्रति परिणाम लागत 0.740 1.570
कुल लागत $0.030 $0.057
इनपुट कीमत $0.250 / 1M $1.250 / 1M
आउटपुट कीमत $0.750 / 1M $2.500 / 1M
कुल इनपुट टोकन 89,637 41,313
आउटपुट टोकन 9,584 1,923
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 825ms 1.11s
प्रतिक्रिया समय (अधिकतम) 4.52s 6.04s
प्रतिक्रिया समय (कुल) 18.14s 19.96s
पैरामीटर ~100B ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#259 Mercury 2

none
लागत
$0.002
समय
1.8s
टोकन
1,514 tok

#269 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें