नेविगेशन
Advertise here

Mercury 2.5 Preview (medium) vs GPT-5.6 Luna (low)

average score लगभग बराबर है: 6.8 vs 6.9. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.037 vs $0.075. Mercury 2.5 Preview (medium) तेज है: 6.66s vs 6.96s, pass rates 66.7% vs 56.5%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#171
कुल आउटपुट टोकन
150,107
प्रतिक्रिया समय (औसत)
6.66s
कुल लागत
$0.037
रैंक
#165
कुल आउटपुट टोकन
28,001
प्रतिक्रिया समय (औसत)
6.96s
कुल लागत
$0.075
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (6.8), while costing about 2.0x less than GPT-5.6 Luna (low).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02 GPT-5.6 Luna GPT-5.6 Luna low रिलीज़: 2026-07-09
स्कोर 6.8 6.9
रैंक #171 #165
विश्वसनीयता 10.0 10.0
संगति 9.6 8.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 66.7% 56.5%
अस्थिर टेस्ट 1 5
कुल रन 69 69
प्रति परिणाम लागत 0.244 2.428
कुल लागत $0.037 $0.075
इनपुट कीमत $0.000 / 1M $0.200 / 1M
आउटपुट कीमत $0.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 397,291 202,680
आउटपुट टोकन 6,355 9,230
रीजनिंग टोकन 143,752 18,771
प्रतिक्रिया समय (औसत) 6.66s 6.96s
प्रतिक्रिया समय (अधिकतम) 74.63s 45.74s
प्रतिक्रिया समय (कुल) 153.29s 160.19s
पैरामीटर ~100B ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#171 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

#165 GPT-5.6 Luna

low
लागत
$0.011
समय
10.2s
टोकन
1,897 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

त्वरित तुलना

तुलना जोड़ी बदलें