नेविगेशन
Advertise here

Mercury 2.5 Preview (medium) vs GPT-6 Sol

average score लगभग बराबर है: 6.8 vs 6.8. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.037 vs $0.551. Mercury 2.5 Preview (medium) तेज है: 6.66s vs 9.02s, pass rates 66.7% vs 63.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#171
कुल आउटपुट टोकन
150,107
प्रतिक्रिया समय (औसत)
6.66s
कुल लागत
$0.037
रैंक
#172
कुल आउटपुट टोकन
7,989
प्रतिक्रिया समय (औसत)
9.02s
कुल लागत
$0.551
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (6.8), while costing about 15.0x less than GPT-6 Sol.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02 GPT-6 Sol GPT-6 Sol none रिलीज़: 2026-09-23
स्कोर 6.8 6.8
रैंक #171 #172
विश्वसनीयता 10.0 10.0
संगति 9.6 8.5
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 66.7% 63.8%
अस्थिर टेस्ट 1 4
कुल रन 69 69
प्रति परिणाम लागत 0.244 4.232
कुल लागत $0.037 $0.551
इनपुट कीमत $0.000 / 1M $2.000 / 1M
आउटपुट कीमत $0.000 / 1M $10.000 / 1M
कुल इनपुट टोकन 397,291 235,086
आउटपुट टोकन 6,355 7,989
रीजनिंग टोकन 143,752 0
प्रतिक्रिया समय (औसत) 6.66s 9.02s
प्रतिक्रिया समय (अधिकतम) 74.63s 57.02s
प्रतिक्रिया समय (कुल) 153.29s 207.45s
पैरामीटर ~100B ~2T कुल (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#171 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

#172 GPT-6 Sol

none
लागत
$0.030
समय
31.9s
टोकन
3,055 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-6 Sol 5.5 10.0 33.3% 0 12.23s 7,302 389 0

त्वरित तुलना

तुलना जोड़ी बदलें