नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (low) vs GPT-4o-mini

Mercury 2.5 (low) average score में आगे है: 5.1 vs 5.0. GPT-4o-mini की benchmark लागत कम है: $0.010 vs $0.011. Mercury 2.5 (low) तेज है: 1.35s vs 1.92s, pass rates 39.4% vs 22.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#265
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
रैंक
#274
कुल आउटपुट टोकन
2,913
प्रतिक्रिया समय (औसत)
1.92s
कुल लागत
$0.010
अनुशंसित मॉडल Mercury 2.5 (low)

It has the strongest score in this comparison (5.1) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08 GPT-4o-mini GPT-4o-mini none रिलीज़: 2024-07-18
स्कोर 5.1 5.0
रैंक #265 #274
विश्वसनीयता 9.8 10.0
संगति 8.1 9.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 39.4% 22.7%
अस्थिर टेस्ट 5 0
कुल रन 66 66
प्रति परिणाम लागत 0.177 0.195
कुल लागत $0.011 $0.010
इनपुट कीमत $0.040 / 1M $0.150 / 1M
आउटपुट कीमत $0.150 / 1M $0.600 / 1M
कुल इनपुट टोकन 138,020 53,145
आउटपुट टोकन 6,083 2,913
रीजनिंग टोकन 27,636 0
प्रतिक्रिया समय (औसत) 1.35s 1.92s
प्रतिक्रिया समय (अधिकतम) 7.48s 7.58s
प्रतिक्रिया समय (कुल) 29.74s 30.71s
पैरामीटर ~100B ~8B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#265 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

#274 GPT-4o-mini

none
लागत
$0.001
समय
6.6s
टोकन
742 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
GPT-4o-mini 3.2 9.6 0.0% 0 1.63s 7,314 367 0

त्वरित तुलना

तुलना जोड़ी बदलें