नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs GPT-5.3 Chat

GPT-5.3 Chat average score में आगे है: 7.5 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.093 vs $0.571. Mercury 2 (medium) तेज है: 2.72s vs 6.88s, pass rates 51.5% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

रैंक
#86
कुल आउटपुट टोकन
87,119
प्रतिक्रिया समय (औसत)
2.72s
कुल लागत
$0.093
रैंक
#62
कुल आउटपुट टोकन
30,854
प्रतिक्रिया समय (औसत)
6.88s
कुल लागत
$0.571
अनुशंसित मॉडल Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.5), while costing about 6.1x less than GPT-5.3 Chat.

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03
स्कोर 7.0 7.5
रैंक #86 #62
विश्वसनीयता 10.0 10.0
संगति 8.8 8.2
सही परीक्षण
प्रति प्रयास पास दर 51.5% 68.2%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 0.928 4.387
कुल लागत $0.093 $0.571
इनपुट कीमत $0.250 / 1M $1.750 / 1M
आउटपुट कीमत $0.750 / 1M $14.000 / 1M
कुल इनपुट टोकन 109,572 78,990
आउटपुट टोकन 10,313 30,854
रीजनिंग टोकन 76,806 0
प्रतिक्रिया समय (औसत) 2.72s 6.88s
प्रतिक्रिया समय (अधिकतम) 14.63s 18.33s
प्रतिक्रिया समय (कुल) 57.12s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#86 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#62 GPT-5.3 Chat

none
लागत
$0.008
समय
8.1s
टोकन
634 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

त्वरित तुलना

तुलना जोड़ी बदलें