नेविगेशन
Advertise here

Mercury 2.5 Preview (high) vs Grok 4.3 (medium)

average score लगभग बराबर है: 6.5 vs 6.5. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.039 vs $0.989. Mercury 2.5 Preview (high) तेज है: 7.61s vs 44.53s, pass rates 65.2% vs 63.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#194
कुल आउटपुट टोकन
180,597
प्रतिक्रिया समय (औसत)
7.61s
कुल लागत
$0.039
रैंक
#199
कुल आउटपुट टोकन
232,542
प्रतिक्रिया समय (औसत)
44.53s
कुल लागत
$0.989
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.5), while costing about 25.9x less than Grok 4.3 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर 6.5 6.5
रैंक #194 #199
विश्वसनीयता 9.9 10.0
संगति 8.0 8.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 65.2% 63.8%
अस्थिर टेस्ट 6 5
कुल रन 69 69
प्रति परिणाम लागत 0.319 8.235
कुल लागत $0.039 $0.989
इनपुट कीमत $0.000 / 1M $1.250 / 1M
आउटपुट कीमत $0.000 / 1M $2.500 / 1M
कुल इनपुट टोकन 298,512 325,471
आउटपुट टोकन 3,178 14,867
रीजनिंग टोकन 177,419 217,675
प्रतिक्रिया समय (औसत) 7.61s 44.53s
प्रतिक्रिया समय (अधिकतम) 86.84s 216.69s
प्रतिक्रिया समय (कुल) 175.08s 1024.25s
पैरामीटर ~100B ~1.5T कुल (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#194 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#199 SpaceXAI: Grok 4.3

medium
लागत
$0.009
समय
19.0s
टोकन
3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

त्वरित तुलना

तुलना जोड़ी बदलें