नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs GPT-5.3 Chat

GPT-5.3 Chat average score मध्ये पुढे आहे: 7.5 vs 7.0. Mercury 2 (medium) चा benchmark खर्च कमी आहे: $0.093 vs $0.571. Mercury 2 (medium) वेगवान आहे: 2.72s vs 6.88s, pass rates 51.5% vs 68.2%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-25

क्रमांक
#86
एकूण आउटपुट टोकन्स
87,119
प्रतिसाद वेळ (सरासरी)
2.72s
एकूण खर्च
$0.093
क्रमांक
#62
एकूण आउटपुट टोकन्स
30,854
प्रतिसाद वेळ (सरासरी)
6.88s
एकूण खर्च
$0.571
शिफारस केलेले मॉडेल Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.5), while costing about 6.1x less than GPT-5.3 Chat.

तपशीलवार तुलना

मेट्रिक Mercury 2 Mercury 2 medium प्रकाशन: 2026-02-24 GPT-5.3 Chat GPT-5.3 Chat none प्रकाशन: 2026-03-03
स्कोअर 7.0 7.5
क्रमांक #86 #62
विश्वसनीयता 10.0 10.0
सुसंगतता 8.8 8.2
बरोबर चाचण्या
प्रति प्रयत्न पास दर 51.5% 68.2%
अस्थिर चाचण्या 3 5
एकूण रन 66 66
प्रति निकाल खर्च 0.928 4.387
एकूण खर्च $0.093 $0.571
इनपुट किंमत $0.250 / 1M $1.750 / 1M
आउटपुट किंमत $0.750 / 1M $14.000 / 1M
एकूण इनपुट टोकन्स 109,572 78,990
आउटपुट टोकन्स 10,313 30,854
रिझनिंग टोकन्स 76,806 0
प्रतिसाद वेळ (सरासरी) 2.72s 6.88s
प्रतिसाद वेळ (कमाल) 14.63s 18.33s
प्रतिसाद वेळ (एकूण) 57.12s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#86 Mercury 2

medium
खर्च
$0.002
वेळ
2.1s
टोकन्स
1,702 tok

#62 GPT-5.3 Chat

none
खर्च
$0.008
वेळ
8.1s
टोकन्स
634 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

झटपट तुलना

तुलना जोडी बदला