नेविगेशन
AI BENCHY
Advertise here

DeepSeek V3.2 vs Mercury 2.5 Preview

DeepSeek V3.2 average score में आगे है: 5.0 vs 4.9. Mercury 2.5 Preview की benchmark लागत कम है: $0.018 vs $0.054. Mercury 2.5 Preview तेज है: 3.51s vs 17.89s, pass rates 36.4% vs 30.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#256
कुल आउटपुट टोकन
42,099
प्रतिक्रिया समय (औसत)
17.89s
कुल लागत
$0.054
रैंक
#259
कुल आउटपुट टोकन
82,585
प्रतिक्रिया समय (औसत)
3.51s
कुल लागत
$0.018
अनुशंसित मॉडल Mercury 2.5 Preview

Its score stays close to the best score here (4.9 vs 5.0), while costing about 3.0x less than DeepSeek V3.2.

विस्तृत तुलना

मेट्रिक DeepSeek V3.2 DeepSeek V3.2 none रिलीज़: 2025-12-01 Mercury 2.5 Preview Mercury 2.5 Preview none रिलीज़: 2026-09-02
स्कोर 5.0 4.9
रैंक #256 #259
विश्वसनीयता 10.0 10.0
संगति 8.1 8.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 36.4% 30.3%
अस्थिर टेस्ट 5 5
कुल रन 66 66
प्रति परिणाम लागत 0.870 0.440
कुल लागत $0.054 $0.018
इनपुट कीमत $0.269 / 1M $0.040 / 1M
आउटपुट कीमत $0.400 / 1M $0.150 / 1M
कुल इनपुट टोकन 135,831 130,296
आउटपुट टोकन 42,099 82,585
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 17.89s 3.51s
प्रतिक्रिया समय (अधिकतम) 115.89s 60.70s
प्रतिक्रिया समय (कुल) 393.53s 77.28s
पैरामीटर 671B कुल (37B सक्रिय) ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#256 DeepSeek V3.2

none
लागत
$0.002
समय
7.0s
टोकन
1,046 tok

#259 Mercury 2.5 Preview

none
अमान्य SVG
लागत
$0.001
समय
3.3s
टोकन
3,122 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
DeepSeek V3.2 3.1 6.9 11.1% 1 14.54s 7,279 4,528 0
Mercury 2.5 Preview 4.7 7.9 22.2% 1 459ms 7,850 650 0

त्वरित तुलना

तुलना जोड़ी बदलें