नेविगेशन
Advertise here

Mercury 2.5 vs Qwen3.5-9B (medium)

Mercury 2.5 average score में आगे है: 3.9 vs 3.8. Mercury 2.5 की benchmark लागत कम है: $0.016 vs $0.062. Mercury 2.5 तेज है: 2.45s vs 107.51s, pass rates 25.8% vs 25.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#312
कुल आउटपुट टोकन
71,143
प्रतिक्रिया समय (औसत)
2.45s
कुल लागत
$0.016
रैंक
#316
कुल आउटपुट टोकन
413,442
प्रतिक्रिया समय (औसत)
107.51s
कुल लागत
$0.062
अनुशंसित मॉडल Mercury 2.5

It has the best score here (3.9), while costing about 4.0x less than Qwen3.5-9B (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 none रिलीज़: 2026-09-08 Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02
स्कोर 3.9 3.8
रैंक #312 #316
विश्वसनीयता 10.0 6.0
संगति 7.5 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 25.8% 25.8%
अस्थिर टेस्ट 7 5
कुल रन 66 66
प्रति परिणाम लागत 0.782 2.061
कुल लागत $0.016 $0.062
इनपुट कीमत $0.040 / 1M $0.100 / 1M
आउटपुट कीमत $0.150 / 1M $0.150 / 1M
कुल इनपुट टोकन 123,740 17,195
आउटपुट टोकन 71,143 46,735
रीजनिंग टोकन 0 366,707
प्रतिक्रिया समय (औसत) 2.45s 107.51s
प्रतिक्रिया समय (अधिकतम) 36.48s 569.97s
प्रतिक्रिया समय (कुल) 53.83s 1720.15s
पैरामीटर ~100B 9B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#312 Mercury 2.5

none
लागत
$0.001
समय
2.7s
टोकन
2,749 tok

#316 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

त्वरित तुलना

तुलना जोड़ी बदलें