नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (medium) vs Qwen3.7 Max

average score लगभग बराबर है: 7.5 vs 7.4. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.024 vs $0.197. Mercury 2.5 Preview (medium) तेज है: 3.58s vs 4.56s, pass rates 69.7% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#91
कुल आउटपुट टोकन
127,034
प्रतिक्रिया समय (औसत)
3.58s
कुल लागत
$0.024
रैंक
#95
कुल आउटपुट टोकन
12,446
प्रतिक्रिया समय (औसत)
4.56s
कुल लागत
$0.197
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (7.5), while costing about 8.3x less than Qwen3.7 Max.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02 Qwen3.7 Max Qwen3.7 Max none रिलीज़: 2026-05-22
स्कोर 7.5 7.4
रैंक #91 #95
विश्वसनीयता 10.0 9.9
संगति 9.6 10.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 69.7% 68.2%
अस्थिर टेस्ट 1 0
कुल रन 66 66
प्रति परिणाम लागत 0.158 1.581
कुल लागत $0.024 $0.197
इनपुट कीमत $0.040 / 1M $1.475 / 1M
आउटपुट कीमत $0.150 / 1M $4.425 / 1M
कुल इनपुट टोकन 112,713 95,992
आउटपुट टोकन 5,436 12,446
रीजनिंग टोकन 121,598 0
प्रतिक्रिया समय (औसत) 3.58s 4.56s
प्रतिक्रिया समय (अधिकतम) 17.84s 72.30s
प्रतिक्रिया समय (कुल) 78.66s 100.30s
पैरामीटर ~100B ~1T कुल (~40B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

#95 Qwen3.7 Max

none
लागत
$0.046
समय
195.0s
टोकन
12,171 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0

त्वरित तुलना

तुलना जोड़ी बदलें