नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs Grok 4.3 (medium)

average score लगभग बराबर है: 7.0 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $0.741. Mercury 2 (medium) तेज है: 2.95s vs 44.21s, pass rates 53.0% vs 66.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#125
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
रैंक
#120
कुल आउटपुट टोकन
225,904
प्रतिक्रिया समय (औसत)
44.21s
कुल लागत
$0.741
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (7.0), while costing about 7.9x less than Grok 4.3 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर 7.0 7.0
रैंक #125 #120
विश्वसनीयता 10.0 10.0
संगति 8.4 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 53.0% 66.7%
अस्थिर टेस्ट 4 5
कुल रन 66 66
प्रति परिणाम लागत 0.933 6.168
कुल लागत $0.094 $0.741
इनपुट कीमत $0.250 / 1M $1.250 / 1M
आउटपुट कीमत $0.750 / 1M $2.500 / 1M
कुल इनपुट टोकन 110,515 140,244
आउटपुट टोकन 10,325 13,739
रीजनिंग टोकन 77,229 212,165
प्रतिक्रिया समय (औसत) 2.95s 44.21s
प्रतिक्रिया समय (अधिकतम) 14.63s 216.69s
प्रतिक्रिया समय (कुल) 61.89s 972.64s
पैरामीटर ~100B ~1.5T कुल (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#125 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#120 SpaceXAI: Grok 4.3

medium
लागत
$0.009
समय
19.0s
टोकन
3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

त्वरित तुलना

तुलना जोड़ी बदलें