नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

DeepSeek V3.2 vs Mercury 2.5 (low)

Mercury 2.5 (low) average score में आगे है: 5.1 vs 5.0. Mercury 2.5 (low) की benchmark लागत कम है: $0.011 vs $0.054. Mercury 2.5 (low) तेज है: 1.35s vs 17.89s, pass rates 36.4% vs 39.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#273
कुल आउटपुट टोकन
42,099
प्रतिक्रिया समय (औसत)
17.89s
कुल लागत
$0.054
रैंक
#265
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
अनुशंसित मॉडल Mercury 2.5 (low)

It has the best score here (5.1), while costing about 5.0x less than DeepSeek V3.2.

विस्तृत तुलना

मेट्रिक DeepSeek V3.2 DeepSeek V3.2 none रिलीज़: 2025-12-01 Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08
स्कोर 5.0 5.1
रैंक #273 #265
विश्वसनीयता 10.0 9.8
संगति 8.1 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 36.4% 39.4%
अस्थिर टेस्ट 5 5
कुल रन 66 66
प्रति परिणाम लागत 0.870 0.177
कुल लागत $0.054 $0.011
इनपुट कीमत $0.269 / 1M $0.040 / 1M
आउटपुट कीमत $0.400 / 1M $0.150 / 1M
कुल इनपुट टोकन 135,831 138,020
आउटपुट टोकन 42,099 6,083
रीजनिंग टोकन 0 27,636
प्रतिक्रिया समय (औसत) 17.89s 1.35s
प्रतिक्रिया समय (अधिकतम) 115.89s 7.48s
प्रतिक्रिया समय (कुल) 393.53s 29.74s
पैरामीटर 671B कुल (37B सक्रिय) ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#273 DeepSeek V3.2

none
लागत
$0.002
समय
7.0s
टोकन
1,046 tok

#265 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
DeepSeek V3.2 3.1 6.9 11.1% 1 14.54s 7,279 4,528 0
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269

त्वरित तुलना

तुलना जोड़ी बदलें