नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (medium) vs GPT-5.4 Mini (medium)

average score लगभग बराबर है: 7.5 vs 7.5. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.024 vs $0.786. Mercury 2.5 Preview (medium) तेज है: 3.58s vs 26.72s, pass rates 69.7% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#91
कुल आउटपुट टोकन
127,034
प्रतिक्रिया समय (औसत)
3.58s
कुल लागत
$0.024
रैंक
#92
कुल आउटपुट टोकन
158,344
प्रतिक्रिया समय (औसत)
26.72s
कुल लागत
$0.786
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (7.5), while costing about 33.3x less than GPT-5.4 Mini (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02 GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17
स्कोर 7.5 7.5
रैंक #91 #92
विश्वसनीयता 10.0 10.0
संगति 9.6 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 69.7% 68.2%
अस्थिर टेस्ट 1 5
कुल रन 66 66
प्रति परिणाम लागत 0.158 6.546
कुल लागत $0.024 $0.786
इनपुट कीमत $0.040 / 1M $0.750 / 1M
आउटपुट कीमत $0.150 / 1M $4.500 / 1M
कुल इनपुट टोकन 112,713 97,164
आउटपुट टोकन 5,436 6,211
रीजनिंग टोकन 121,598 152,133
प्रतिक्रिया समय (औसत) 3.58s 26.72s
प्रतिक्रिया समय (अधिकतम) 17.84s 138.75s
प्रतिक्रिया समय (कुल) 78.66s 587.90s
पैरामीटर ~100B ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

#92 GPT-5.4 Mini

medium
लागत
$0.056
समय
95.5s
टोकन
12,464 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-5.4 Mini 8.4 7.4 88.9% 1 57.87s 7,305 467 40,902

त्वरित तुलना

तुलना जोड़ी बदलें