नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (high) vs GPT-6 Luna (low)

average score लगभग बराबर है: 7.1 vs 7.0. GPT-6 Luna (low) की benchmark लागत कम है: $0.020 vs $0.031. Mercury 2.5 (high) तेज है: 4.32s vs 21.96s, pass rates 62.1% vs 62.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-23

तुलना किए गए मॉडल

रैंक
#156
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#159
कुल आउटपुट टोकन
22,605
प्रतिक्रिया समय (औसत)
21.96s
कुल लागत
$0.020
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while responding about 5.1x faster than GPT-6 Luna (low).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 GPT-6 Luna GPT-6 Luna low रिलीज़: 2026-09-23
स्कोर 7.1 7.0
रैंक #156 #159
विश्वसनीयता 9.7 9.6
संगति 8.6 8.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 62.1%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.259 0.176
कुल लागत $0.031 $0.020
इनपुट कीमत $0.040 / 1M $0.100 / 1M
आउटपुट कीमत $0.150 / 1M $0.500 / 1M
कुल इनपुट टोकन 120,068 80,159
आउटपुट टोकन 3,402 4,623
रीजनिंग टोकन 171,145 17,982
प्रतिक्रिया समय (औसत) 4.32s 21.96s
प्रतिक्रिया समय (अधिकतम) 23.63s 89.37s
प्रतिक्रिया समय (कुल) 95.06s 483.19s
पैरामीटर ~100B ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#156 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#159 GPT-6 Luna

low
लागत
$0.002
समय
19.2s
टोकन
2,598 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
GPT-6 Luna 6.0 7.2 55.6% 1 15.39s 7,302 493 6,655

त्वरित तुलना

तुलना जोड़ी बदलें