नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (high) vs Qwen3.5 Plus 2026-02-15

average score लगभग बराबर है: 6.6 vs 6.6. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.030 vs $0.073. Mercury 2.5 Preview (high) तेज है: 4.01s vs 9.86s, pass rates 65.2% vs 53.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#157
कुल आउटपुट टोकन
163,505
प्रतिक्रिया समय (औसत)
4.01s
कुल लागत
$0.030
रैंक
#158
कुल आउटपुट टोकन
29,370
प्रतिक्रिया समय (औसत)
9.86s
कुल लागत
$0.073
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.6), while costing about 2.5x less than Qwen3.5 Plus 2026-02-15.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none रिलीज़: 2026-02-15
स्कोर 6.6 6.6
रैंक #157 #158
विश्वसनीयता 10.0 10.0
संगति 8.2 9.4
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 53.0%
अस्थिर टेस्ट 5 2
कुल रन 66 66
प्रति परिणाम लागत 0.243 0.682
कुल लागत $0.030 $0.073
इनपुट कीमत $0.040 / 1M $0.260 / 1M
आउटपुट कीमत $0.150 / 1M $1.560 / 1M
कुल इनपुट टोकन 115,759 102,655
आउटपुट टोकन 2,562 29,370
रीजनिंग टोकन 160,943 0
प्रतिक्रिया समय (औसत) 4.01s 9.86s
प्रतिक्रिया समय (अधिकतम) 17.71s 123.00s
प्रतिक्रिया समय (कुल) 88.25s 157.77s
पैरामीटर ~100B ~397B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#158 Qwen3.5 Plus 2026-02-15

none
लागत
$0.012
समय
153.2s
टोकन
7,787 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
Qwen3.5 Plus 2026-02-15 4.3 7.9 11.1% 1 2.05s 7,913 473 0

त्वरित तुलना

तुलना जोड़ी बदलें