नेविगेशन
Advertise here

Mercury 2.5 (low) vs Qwen3.6 35B A3B

Qwen3.6 35B A3B average score में आगे है: 5.3 vs 5.1. Mercury 2.5 (low) की benchmark लागत कम है: $0.011 vs $0.051. Mercury 2.5 (low) तेज है: 1.35s vs 5.57s, pass rates 39.4% vs 28.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#265
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
रैंक
#256
कुल आउटपुट टोकन
45,905
प्रतिक्रिया समय (औसत)
5.57s
कुल लागत
$0.051
अनुशंसित मॉडल Mercury 2.5 (low)

Its score stays close to the best score here (5.1 vs 5.3), while costing about 4.8x less than Qwen3.6 35B A3B.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08 Qwen3.6 35B A3B Qwen3.6 35B A3B none रिलीज़: 2026-04-20
स्कोर 5.1 5.3
रैंक #265 #256
विश्वसनीयता 9.8 10.0
संगति 8.1 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 39.4% 28.8%
अस्थिर टेस्ट 5 5
कुल रन 66 66
प्रति परिणाम लागत 0.177 1.470
कुल लागत $0.011 $0.051
इनपुट कीमत $0.040 / 1M $0.100 / 1M
आउटपुट कीमत $0.150 / 1M $0.900 / 1M
कुल इनपुट टोकन 138,020 93,990
आउटपुट टोकन 6,083 45,905
रीजनिंग टोकन 27,636 0
प्रतिक्रिया समय (औसत) 1.35s 5.57s
प्रतिक्रिया समय (अधिकतम) 7.48s 39.54s
प्रतिक्रिया समय (कुल) 29.74s 111.32s
पैरामीटर ~100B 35B कुल (3B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#265 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

#256 Qwen3.6 35B A3B

none
लागत
$0.008
समय
30.1s
टोकन
6,317 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
Qwen3.6 35B A3B 5.5 10.0 33.3% 0 8.77s 7,911 11,161 0

त्वरित तुलना

तुलना जोड़ी बदलें