नेव्हिगेशन
Advertise here

Mercury 2.5 (high) vs Grok 4.3 (medium)

average score जवळपास समान आहे: 7.1 vs 7.0. Mercury 2.5 (high) चा benchmark खर्च कमी आहे: $0.031 vs $0.741. Mercury 2.5 (high) वेगवान आहे: 4.32s vs 44.21s, pass rates 62.1% vs 66.7%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-08

तुलना केलेली मॉडेल्स

क्रमांक
#134
एकूण आउटपुट टोकन्स
174,547
प्रतिसाद वेळ (सरासरी)
4.32s
एकूण खर्च
$0.031
क्रमांक
#135
एकूण आउटपुट टोकन्स
225,904
प्रतिसाद वेळ (सरासरी)
44.21s
एकूण खर्च
$0.741
शिफारस केलेले मॉडेल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 23.9x less than Grok 4.3 (medium).

तपशीलवार तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high प्रकाशन: 2026-09-08 Grok 4.3 Grok 4.3 medium प्रकाशन: 2026-05-01
स्कोअर 7.1 7.0
क्रमांक #134 #135
विश्वसनीयता 9.7 10.0
सुसंगतता 8.6 8.2
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 62.1% 66.7%
अस्थिर चाचण्या 4 5
एकूण रन 66 66
प्रति निकाल खर्च 0.259 6.168
एकूण खर्च $0.031 $0.741
इनपुट किंमत $0.040 / 1M $1.250 / 1M
आउटपुट किंमत $0.150 / 1M $2.500 / 1M
एकूण इनपुट टोकन्स 120,068 140,244
आउटपुट टोकन्स 3,402 13,739
रिझनिंग टोकन्स 171,145 212,165
प्रतिसाद वेळ (सरासरी) 4.32s 44.21s
प्रतिसाद वेळ (कमाल) 23.63s 216.69s
प्रतिसाद वेळ (एकूण) 95.06s 972.64s
पॅरामीटर्स ~100B ~1.5T एकूण (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
खर्च
$0.001
वेळ
3.5s
टोकन्स
2,447 tok

#135 SpaceXAI: Grok 4.3

medium
खर्च
$0.009
वेळ
19.0s
टोकन्स
3,661 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

झटपट तुलना

तुलना जोडी बदला