नेविगेशन
Advertise here

Claude Opus 4.8 vs Mercury 2.5 Preview (medium)

average score लगभग बराबर है: 6.9 vs 6.8. Mercury 2.5 Preview (medium) की benchmark लागत कम है: $0.037 vs $2.334. Mercury 2.5 Preview (medium) तेज है: 6.66s vs 7.54s, pass rates 60.9% vs 66.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#167
कुल आउटपुट टोकन
24,343
प्रतिक्रिया समय (औसत)
7.54s
कुल लागत
$2.334
रैंक
#171
कुल आउटपुट टोकन
150,107
प्रतिक्रिया समय (औसत)
6.66s
कुल लागत
$0.037
अनुशंसित मॉडल Mercury 2.5 Preview (medium)

It has the best score here (6.8), while costing about 63.8x less than Claude Opus 4.8.

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 Mercury 2.5 Preview Mercury 2.5 Preview medium रिलीज़: 2026-09-02
स्कोर 6.9 6.8
रैंक #167 #171
विश्वसनीयता 10.0 10.0
संगति 9.3 9.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 60.9% 66.7%
अस्थिर टेस्ट 2 1
कुल रन 69 69
प्रति परिणाम लागत 17.953 0.244
कुल लागत $2.334 $0.037
इनपुट कीमत $5.000 / 1M $0.000 / 1M
आउटपुट कीमत $25.000 / 1M $0.000 / 1M
कुल इनपुट टोकन 345,059 397,291
आउटपुट टोकन 24,343 6,355
रीजनिंग टोकन 0 143,752
प्रतिक्रिया समय (औसत) 7.54s 6.66s
प्रतिक्रिया समय (अधिकतम) 65.07s 74.63s
प्रतिक्रिया समय (कुल) 173.31s 153.29s
पैरामीटर ~5T कुल (~500B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#167 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#171 Mercury 2.5 Preview

medium
लागत
$0.001
समय
2.7s
टोकन
2,241 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126

त्वरित तुलना

तुलना जोड़ी बदलें