नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview vs GPT-4o-mini

average score लगभग बराबर है: 4.9 vs 5.0. GPT-4o-mini की benchmark लागत कम है: $0.010 vs $0.018. GPT-4o-mini तेज है: 1.92s vs 3.51s, pass rates 30.3% vs 22.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#259
कुल आउटपुट टोकन
82,585
प्रतिक्रिया समय (औसत)
3.51s
कुल लागत
$0.018
रैंक
#257
कुल आउटपुट टोकन
2,913
प्रतिक्रिया समय (औसत)
1.92s
कुल लागत
$0.010
अनुशंसित मॉडल GPT-4o-mini

It has the best score here (5.0), while costing about 1.8x less than Mercury 2.5 Preview.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview none रिलीज़: 2026-09-02 GPT-4o-mini GPT-4o-mini none रिलीज़: 2024-07-18
स्कोर 4.9 5.0
रैंक #259 #257
विश्वसनीयता 10.0 10.0
संगति 8.3 9.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 30.3% 22.7%
अस्थिर टेस्ट 5 0
कुल रन 66 66
प्रति परिणाम लागत 0.440 0.195
कुल लागत $0.018 $0.010
इनपुट कीमत $0.040 / 1M $0.150 / 1M
आउटपुट कीमत $0.150 / 1M $0.600 / 1M
कुल इनपुट टोकन 130,296 53,145
आउटपुट टोकन 82,585 2,913
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 3.51s 1.92s
प्रतिक्रिया समय (अधिकतम) 60.70s 7.58s
प्रतिक्रिया समय (कुल) 77.28s 30.71s
पैरामीटर ~100B ~8B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#259 Mercury 2.5 Preview

none
अमान्य SVG
लागत
$0.001
समय
3.3s
टोकन
3,122 tok

#257 GPT-4o-mini

none
लागत
$0.001
समय
6.6s
टोकन
742 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 4.7 7.9 22.2% 1 459ms 7,850 650 0
GPT-4o-mini 3.2 9.6 0.0% 0 1.63s 7,314 367 0

त्वरित तुलना

तुलना जोड़ी बदलें