नेव्हिगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs GPT-5.6 Sol

average score जवळपास समान आहे: 7.0 vs 7.0. Mercury 2 (medium) चा benchmark खर्च कमी आहे: $0.094 vs $0.201. GPT-5.6 Sol वेगवान आहे: 2.17s vs 2.95s, pass rates 53.0% vs 63.6%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-29

क्रमांक
#122
एकूण आउटपुट टोकन्स
87,554
प्रतिसाद वेळ (सरासरी)
2.95s
एकूण खर्च
$0.094
क्रमांक
#118
एकूण आउटपुट टोकन्स
4,357
प्रतिसाद वेळ (सरासरी)
2.17s
एकूण खर्च
$0.201
शिफारस केलेले मॉडेल Mercury 2 (medium)

It has the best score here (7.0), while costing about 2.2x less than GPT-5.6 Sol.

तपशीलवार तुलना

मेट्रिक Mercury 2 Mercury 2 medium प्रकाशन: 2026-02-24 GPT-5.6 Sol GPT-5.6 Sol none प्रकाशन: 2026-07-09
स्कोअर 7.0 7.0
क्रमांक #122 #118
विश्वसनीयता 10.0 10.0
सुसंगतता 8.4 9.0
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 53.0% 63.6%
अस्थिर चाचण्या 4 3
एकूण रन 66 66
प्रति निकाल खर्च 0.933 4.365
एकूण खर्च $0.094 $0.201
इनपुट किंमत $0.250 / 1M $2.000 / 1M
आउटपुट किंमत $0.750 / 1M $10.000 / 1M
एकूण इनपुट टोकन्स 110,515 78,602
आउटपुट टोकन्स 10,325 4,357
रिझनिंग टोकन्स 77,229 0
प्रतिसाद वेळ (सरासरी) 2.95s 2.17s
प्रतिसाद वेळ (कमाल) 14.63s 12.81s
प्रतिसाद वेळ (एकूण) 61.89s 47.66s
पॅरामीटर्स ~100B ~2T एकूण (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 Mercury 2

medium
खर्च
$0.002
वेळ
2.1s
टोकन्स
1,702 tok

#118 GPT-5.6 Sol

none
खर्च
$0.116
वेळ
78.7s
टोकन्स
3,944 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.6 Sol 5.5 10.0 33.3% 0 1.39s 7,302 390 0

झटपट तुलना

तुलना जोडी बदला