नेव्हिगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview vs GPT-4o-mini

average score जवळपास समान आहे: 4.9 vs 5.0. GPT-4o-mini चा benchmark खर्च कमी आहे: $0.010 vs $0.018. GPT-4o-mini वेगवान आहे: 1.92s vs 3.51s, pass rates 30.3% vs 22.7%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-02

क्रमांक
#259
एकूण आउटपुट टोकन्स
82,585
प्रतिसाद वेळ (सरासरी)
3.51s
एकूण खर्च
$0.018
क्रमांक
#257
एकूण आउटपुट टोकन्स
2,913
प्रतिसाद वेळ (सरासरी)
1.92s
एकूण खर्च
$0.010
शिफारस केलेले मॉडेल GPT-4o-mini

It has the best score here (5.0), while costing about 1.8x less than Mercury 2.5 Preview.

तपशीलवार तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview none प्रकाशन: 2026-09-02 GPT-4o-mini GPT-4o-mini none प्रकाशन: 2024-07-18
स्कोअर 4.9 5.0
क्रमांक #259 #257
विश्वसनीयता 10.0 10.0
सुसंगतता 8.3 9.9
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 30.3% 22.7%
अस्थिर चाचण्या 5 0
एकूण रन 66 66
प्रति निकाल खर्च 0.440 0.195
एकूण खर्च $0.018 $0.010
इनपुट किंमत $0.040 / 1M $0.150 / 1M
आउटपुट किंमत $0.150 / 1M $0.600 / 1M
एकूण इनपुट टोकन्स 130,296 53,145
आउटपुट टोकन्स 82,585 2,913
रिझनिंग टोकन्स 0 0
प्रतिसाद वेळ (सरासरी) 3.51s 1.92s
प्रतिसाद वेळ (कमाल) 60.70s 7.58s
प्रतिसाद वेळ (एकूण) 77.28s 30.71s
पॅरामीटर्स ~100B ~8B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#259 Mercury 2.5 Preview

none
अवैध SVG
खर्च
$0.001
वेळ
3.3s
टोकन्स
3,122 tok

#257 GPT-4o-mini

none
खर्च
$0.001
वेळ
6.6s
टोकन्स
742 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2.5 Preview 4.7 7.9 22.2% 1 459ms 7,850 650 0
GPT-4o-mini 3.2 9.6 0.0% 0 1.63s 7,314 367 0

झटपट तुलना

तुलना जोडी बदला