नेविगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs GPT-5.6 Sol

average score लगभग बराबर है: 7.0 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $0.201. GPT-5.6 Sol तेज है: 2.17s vs 2.95s, pass rates 53.0% vs 63.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-29

रैंक
#122
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
रैंक
#118
कुल आउटपुट टोकन
4,357
प्रतिक्रिया समय (औसत)
2.17s
कुल लागत
$0.201
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (7.0), while costing about 2.2x less than GPT-5.6 Sol.

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 GPT-5.6 Sol GPT-5.6 Sol none रिलीज़: 2026-07-09
स्कोर 7.0 7.0
रैंक #122 #118
विश्वसनीयता 10.0 10.0
संगति 8.4 9.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 53.0% 63.6%
अस्थिर टेस्ट 4 3
कुल रन 66 66
प्रति परिणाम लागत 0.933 4.365
कुल लागत $0.094 $0.201
इनपुट कीमत $0.250 / 1M $2.000 / 1M
आउटपुट कीमत $0.750 / 1M $10.000 / 1M
कुल इनपुट टोकन 110,515 78,602
आउटपुट टोकन 10,325 4,357
रीजनिंग टोकन 77,229 0
प्रतिक्रिया समय (औसत) 2.95s 2.17s
प्रतिक्रिया समय (अधिकतम) 14.63s 12.81s
प्रतिक्रिया समय (कुल) 61.89s 47.66s
पैरामीटर ~100B ~2T कुल (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#118 GPT-5.6 Sol

none
लागत
$0.116
समय
78.7s
टोकन
3,944 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.6 Sol 5.5 10.0 33.3% 0 1.39s 7,302 390 0

त्वरित तुलना

तुलना जोड़ी बदलें