नेविगेशन
Advertise here

Mercury 2.5 (high) vs Qwen3.5-122B-A10B (medium)

Qwen3.5-122B-A10B (medium) average score में आगे है: 7.1 vs 7.1. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $1.207. Mercury 2.5 (high) तेज है: 4.32s vs 65.67s, pass rates 62.1% vs 71.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#134
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
रैंक
#130
कुल आउटपुट टोकन
487,519
प्रतिक्रिया समय (औसत)
65.67s
कुल लागत
$1.207
अनुशंसित मॉडल Mercury 2.5 (high)

Its score stays close to the best score here (7.1 vs 7.1), while costing about 38.9x less than Qwen3.5-122B-A10B (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium रिलीज़: 2026-02-24
स्कोर 7.1 7.1
रैंक #134 #130
विश्वसनीयता 9.7 10.0
संगति 8.6 8.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 71.2%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.259 8.446
कुल लागत $0.031 $1.207
इनपुट कीमत $0.040 / 1M $0.290 / 1M
आउटपुट कीमत $0.150 / 1M $2.400 / 1M
कुल इनपुट टोकन 120,068 124,780
आउटपुट टोकन 3,402 47,694
रीजनिंग टोकन 171,145 439,825
प्रतिक्रिया समय (औसत) 4.32s 65.67s
प्रतिक्रिया समय (अधिकतम) 23.63s 519.30s
प्रतिक्रिया समय (कुल) 95.06s 1444.68s
पैरामीटर ~100B 122B कुल (10B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#134 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#130 Qwen3.5-122B-A10B

medium
लागत
$0.019
समय
48.7s
टोकन
6,034 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Qwen3.5-122B-A10B 6.0 7.2 55.6% 1 114.48s 7,630 8,057 82,578

त्वरित तुलना

तुलना जोड़ी बदलें