नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 vs Qwen3.5-9B (medium)

Mercury 2 average score में आगे है: 4.4 vs 4.0. Mercury 2 की benchmark लागत कम है: $0.033 vs $0.106. Mercury 2 तेज है: 1.18s vs 110.18s, pass rates 23.2% vs 26.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#338
कुल आउटपुट टोकन
9,709
प्रतिक्रिया समय (औसत)
1.18s
कुल लागत
$0.033
रैंक
#346
कुल आउटपुट टोकन
458,993
प्रतिक्रिया समय (औसत)
110.18s
कुल लागत
$0.106
अनुशंसित मॉडल Mercury 2

It has the best score here (4.4), while costing about 3.3x less than Qwen3.5-9B (medium).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02
स्कोर 4.4 4.0
रैंक #338 #346
विश्वसनीयता 10.0 8.7
संगति 9.2 7.9
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 23.2% 26.1%
अस्थिर टेस्ट 2 6
कुल रन 69 69
प्रति परिणाम लागत 0.812 3.523
कुल लागत $0.033 $0.106
इनपुट कीमत $0.250 / 1M $0.100 / 1M
आउटपुट कीमत $0.750 / 1M $0.150 / 1M
कुल इनपुट टोकन 100,634 387,323
आउटपुट टोकन 9,709 48,562
रीजनिंग टोकन 0 410,431
प्रतिक्रिया समय (औसत) 1.18s 110.18s
प्रतिक्रिया समय (अधिकतम) 9.00s 569.97s
प्रतिक्रिया समय (कुल) 27.14s 1873.00s
पैरामीटर ~100B 9B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#338 Mercury 2

none
लागत
$0.002
समय
1.8s
टोकन
1,514 tok

#346 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

त्वरित तुलना

तुलना जोड़ी बदलें