नेविगेशन
Advertise here

Claude Sonnet 5.5 (medium) vs Mercury 2.5 Preview (high)

average score लगभग बराबर है: 6.5 vs 6.5. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.039 vs $1.100. Mercury 2.5 Preview (high) तेज है: 7.61s vs 8.03s, pass rates 40.6% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#192
कुल आउटपुट टोकन
37,748
प्रतिक्रिया समय (औसत)
8.03s
कुल लागत
$1.100
रैंक
#194
कुल आउटपुट टोकन
180,597
प्रतिक्रिया समय (औसत)
7.61s
कुल लागत
$0.039
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.5), while costing about 28.8x less than Claude Sonnet 5.5 (medium).

विस्तृत तुलना

मेट्रिक Claude Sonnet 5.5 Claude Sonnet 5.5 medium रिलीज़: 2026-09-29 Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02
स्कोर 6.5 6.5
रैंक #192 #194
विश्वसनीयता 10.0 9.9
संगति 9.7 8.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 40.6% 65.2%
अस्थिर टेस्ट 1 6
कुल रन 69 69
प्रति परिणाम लागत 12.221 0.319
कुल लागत $1.100 $0.039
इनपुट कीमत $2.000 / 1M $0.000 / 1M
आउटपुट कीमत $10.000 / 1M $0.000 / 1M
कुल इनपुट टोकन 361,183 298,512
आउटपुट टोकन 26,609 3,178
रीजनिंग टोकन 11,139 177,419
प्रतिक्रिया समय (औसत) 8.03s 7.61s
प्रतिक्रिया समय (अधिकतम) 51.18s 86.84s
प्रतिक्रिया समय (कुल) 184.80s 175.08s
पैरामीटर ~1T कुल (~100B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#192 Claude Sonnet 5.5

medium
लागत
$0.024
समय
17.4s
टोकन
2,525 tok

#194 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 5.5 3.4 9.7 0.0% 0 6.07s 10,608 6,767 0
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569

त्वरित तुलना

तुलना जोड़ी बदलें