नेविगेशन
Advertise here

Mercury 2.5 (medium) vs Qwen3.6 27B

average score लगभग बराबर है: 6.4 vs 6.3. Mercury 2.5 (medium) की benchmark लागत कम है: $0.034 vs $0.147. Mercury 2.5 (medium) तेज है: 7.74s vs 12.71s, pass rates 63.8% vs 47.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#206
कुल आउटपुट टोकन
138,946
प्रतिक्रिया समय (औसत)
7.74s
कुल लागत
$0.034
रैंक
#213
कुल आउटपुट टोकन
20,816
प्रतिक्रिया समय (औसत)
12.71s
कुल लागत
$0.147
अनुशंसित मॉडल Mercury 2.5 (medium)

It has the best score here (6.4), while costing about 4.4x less than Qwen3.6 27B.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 medium रिलीज़: 2026-09-08 Qwen3.6 27B Qwen3.6 27B none रिलीज़: 2026-04-20
स्कोर 6.4 6.3
रैंक #206 #213
विश्वसनीयता 9.7 10.0
संगति 8.3 7.7
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 63.8% 47.8%
अस्थिर टेस्ट 5 6
कुल रन 69 69
प्रति परिणाम लागत 0.280 1.874
कुल लागत $0.034 $0.147
इनपुट कीमत $0.040 / 1M $0.320 / 1M
आउटपुट कीमत $0.150 / 1M $3.200 / 1M
कुल इनपुट टोकन 317,982 250,919
आउटपुट टोकन 3,918 20,816
रीजनिंग टोकन 135,028 0
प्रतिक्रिया समय (औसत) 7.74s 12.71s
प्रतिक्रिया समय (अधिकतम) 107.89s 156.31s
प्रतिक्रिया समय (कुल) 178.07s 292.29s
पैरामीटर ~100B 27B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#206 Mercury 2.5

medium
लागत
$0.001
समय
3.8s
टोकन
3,386 tok

#213 Qwen3.6 27B

none
लागत
$0.009
समय
83.0s
टोकन
4,549 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
Qwen3.6 27B 5.5 10.0 33.3% 0 4.16s 7,913 539 0

त्वरित तुलना

तुलना जोड़ी बदलें