नेविगेशन
AI BENCHY
Advertise here

DeepSeek V3.2 vs Mercury 2.5 Preview (low)

average score लगभग बराबर है: 5.0 vs 5.0. Mercury 2.5 Preview (low) की benchmark लागत कम है: $0.011 vs $0.054. Mercury 2.5 Preview (low) तेज है: 1.31s vs 17.89s, pass rates 36.4% vs 47.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#256
कुल आउटपुट टोकन
42,099
प्रतिक्रिया समय (औसत)
17.89s
कुल लागत
$0.054
रैंक
#254
कुल आउटपुट टोकन
31,975
प्रतिक्रिया समय (औसत)
1.31s
कुल लागत
$0.011
अनुशंसित मॉडल Mercury 2.5 Preview (low)

It has the best score here (5.0), while costing about 5.3x less than DeepSeek V3.2.

विस्तृत तुलना

मेट्रिक DeepSeek V3.2 DeepSeek V3.2 none रिलीज़: 2025-12-01 Mercury 2.5 Preview Mercury 2.5 Preview low रिलीज़: 2026-09-02
स्कोर 5.0 5.0
रैंक #256 #254
विश्वसनीयता 10.0 10.0
संगति 8.1 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 36.4% 47.0%
अस्थिर टेस्ट 5 8
कुल रन 66 66
प्रति परिणाम लागत 0.870 0.169
कुल लागत $0.054 $0.011
इनपुट कीमत $0.269 / 1M $0.040 / 1M
आउटपुट कीमत $0.400 / 1M $0.150 / 1M
कुल इनपुट टोकन 135,831 133,525
आउटपुट टोकन 42,099 7,259
रीजनिंग टोकन 0 24,716
प्रतिक्रिया समय (औसत) 17.89s 1.31s
प्रतिक्रिया समय (अधिकतम) 115.89s 7.29s
प्रतिक्रिया समय (कुल) 393.53s 28.77s
पैरामीटर 671B कुल (37B सक्रिय) ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#256 DeepSeek V3.2

none
लागत
$0.002
समय
7.0s
टोकन
1,046 tok

#254 Mercury 2.5 Preview

low
लागत
$0.001
समय
1.5s
टोकन
1,169 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
DeepSeek V3.2 3.1 6.9 11.1% 1 14.54s 7,279 4,528 0
Mercury 2.5 Preview 5.5 10.0 33.3% 0 972ms 7,794 695 2,263

त्वरित तुलना

तुलना जोड़ी बदलें