नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Inception: Mercury 2 vs Qwen: Qwen3.5-9B

Mercury 2 average score में आगे है: 4.6 vs 3.8. Mercury 2 की benchmark लागत कम है: $0.030 vs $0.036. Mercury 2 तेज है: 829ms vs 82.24s, pass rates 22.7% vs 25.8%.

अनुशंसित मॉडलMercury 2It has the best score here (4.6), while responding about 99.2x faster than Qwen3.5-9B (medium).
रैंक
#204
प्रति प्रयास पास दर
22.7%
कुल आउटपुट टोकन
9,564
प्रतिक्रिया समय (औसत)
829ms
कुल लागत
$0.030
रैंक
#220
प्रति प्रयास पास दर
25.8%
कुल आउटपुट टोकन
238,561
प्रतिक्रिया समय (औसत)
82.24s
कुल लागत
$0.036

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02
स्कोर 4.6 3.8
रैंक #204 #220
विश्वसनीयता 10.0 5.0
संगति 9.2 8.1
सही परीक्षण
प्रति प्रयास पास दर 22.7% 25.8%
अस्थिर टेस्ट 2 5
कुल रन 66 66
प्रति परिणाम लागत 0.734 1.187
कुल लागत $0.030 $0.036
इनपुट कीमत $0.250 / 1M $0.100 / 1M
आउटपुट कीमत $0.750 / 1M $0.150 / 1M
कुल इनपुट टोकन 88,704 17,070
आउटपुट टोकन 9,564 29,045
रीजनिंग टोकन 0 209,516
प्रतिक्रिया समय (औसत) 829ms 82.24s
प्रतिक्रिया समय (अधिकतम) 4.52s 226.38s
प्रतिक्रिया समय (कुल) 18.24s 1315.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#204 Mercury 2

none
लागत
$0.002
समय
1.8s
टोकन
1,514 tok

#220 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

त्वरित तुलना

तुलना जोड़ी बदलें