नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (medium) vs GPT 5.3 Chat

average score लगभग बराबर है: 7.5 vs 7.5. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.024 vs $0.533. Mercury 2.5 Preview (medium) तेज है: 3.58s vs 6.56s, pass rates 69.7% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#91
कुल आउटपुट टोकन
127,034
प्रतिक्रिया समय (औसत)
3.58s
कुल लागत
$0.024
रैंक
#88
कुल आउटपुट टोकन
28,179
प्रतिक्रिया समय (औसत)
6.56s
कुल लागत
$0.533
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (7.5), while costing about 22.6x less than GPT 5.3 Chat.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02 GPT 5.3 Chat GPT 5.3 Chat none रिलीज़: 2026-03-03
स्कोर 7.5 7.5
रैंक #91 #88
विश्वसनीयता 10.0 10.0
संगति 9.6 8.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 69.7% 65.2%
अस्थिर टेस्ट 1 4
कुल रन 66 66
प्रति परिणाम लागत 0.158 4.097
कुल लागत $0.024 $0.533
इनपुट कीमत $0.040 / 1M $1.750 / 1M
आउटपुट कीमत $0.150 / 1M $14.000 / 1M
कुल इनपुट टोकन 112,713 78,846
आउटपुट टोकन 5,436 28,179
रीजनिंग टोकन 121,598 0
प्रतिक्रिया समय (औसत) 3.58s 6.56s
प्रतिक्रिया समय (अधिकतम) 17.84s 18.33s
प्रतिक्रिया समय (कुल) 78.66s 137.77s
पैरामीटर ~100B ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

#88 GPT 5.3 Chat

none
लागत
$0.008
समय
8.1s
टोकन
634 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT 5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

त्वरित तुलना

तुलना जोड़ी बदलें