नेविगेशन
Advertise here

DeepSeek V3.2 (medium) vs Mercury 2.5 (high)

Mercury 2.5 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.078. Mercury 2.5 (high) तेज है: 4.32s vs 68.43s, pass rates 65.2% vs 62.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#137
कुल आउटपुट टोकन
128,787
प्रतिक्रिया समय (औसत)
68.43s
कुल लागत
$0.078
रैंक
#134
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 2.5x less than DeepSeek V3.2 (medium).

विस्तृत तुलना

मेट्रिक DeepSeek V3.2 DeepSeek V3.2 medium रिलीज़: 2025-12-01 Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08
स्कोर 7.0 7.1
रैंक #137 #134
विश्वसनीयता 10.0 9.7
संगति 7.4 8.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 62.1%
अस्थिर टेस्ट 7 4
कुल रन 66 66
प्रति परिणाम लागत 0.672 0.259
कुल लागत $0.078 $0.031
इनपुट कीमत $0.269 / 1M $0.040 / 1M
आउटपुट कीमत $0.400 / 1M $0.150 / 1M
कुल इनपुट टोकन 101,056 120,068
आउटपुट टोकन 11,832 3,402
रीजनिंग टोकन 116,955 171,145
प्रतिक्रिया समय (औसत) 68.43s 4.32s
प्रतिक्रिया समय (अधिकतम) 376.10s 23.63s
प्रतिक्रिया समय (कुल) 1505.53s 95.06s
पैरामीटर 671B कुल (37B सक्रिय) ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#137 DeepSeek V3.2

medium
लागत
$0.001
समय
53.6s
टोकन
1,932 tok

#134 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
DeepSeek V3.2 6.0 7.2 55.6% 1 248.68s 5,717 649 52,014
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012

त्वरित तुलना

तुलना जोड़ी बदलें