नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (high) vs Qwen3.6 27B (medium)

Mercury 2.5 Preview (high) average score में आगे है: 6.6 vs 6.5. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.030 vs $1.045. Mercury 2.5 Preview (high) तेज है: 4.01s vs 106.06s, pass rates 65.2% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#157
कुल आउटपुट टोकन
163,505
प्रतिक्रिया समय (औसत)
4.01s
कुल लागत
$0.030
रैंक
#159
कुल आउटपुट टोकन
272,573
प्रतिक्रिया समय (औसत)
106.06s
कुल लागत
$1.045
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.6), while costing about 35.8x less than Qwen3.6 27B (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 Qwen3.6 27B Qwen3.6 27B medium रिलीज़: 2026-04-20
स्कोर 6.6 6.5
रैंक #157 #159
विश्वसनीयता 10.0 10.0
संगति 8.2 7.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 60.6%
अस्थिर टेस्ट 5 7
कुल रन 66 66
प्रति परिणाम लागत 0.243 7.448
कुल लागत $0.030 $1.045
इनपुट कीमत $0.040 / 1M $0.600 / 1M
आउटपुट कीमत $0.150 / 1M $3.600 / 1M
कुल इनपुट टोकन 115,759 106,176
आउटपुट टोकन 2,562 33,013
रीजनिंग टोकन 160,943 239,560
प्रतिक्रिया समय (औसत) 4.01s 106.06s
प्रतिक्रिया समय (अधिकतम) 17.71s 1085.11s
प्रतिक्रिया समय (कुल) 88.25s 2333.36s
पैरामीटर ~100B 27B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#159 Qwen3.6 27B

medium
लागत
$0.009
समय
39.6s
टोकन
3,090 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
Qwen3.6 27B 7.7 10.0 66.7% 0 142.99s 5,051 7,968 43,367

त्वरित तुलना

तुलना जोड़ी बदलें