नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs Inception: Mercury 2

Claude Sonnet 4.6 average score में आगे है: 7.3 vs 7.0. Mercury 2 (medium) की benchmark लागत कम है: $0.093 vs $0.661. Mercury 2 (medium) तेज है: 2.72s vs 8.12s, pass rates 57.6% vs 51.5%.

अनुशंसित मॉडलMercury 2 (medium)Its score stays close to the best score here (7.0 vs 7.3), while costing about 7.1x less than Claude Sonnet 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24
स्कोर 7.3 7.0
रैंक #71 #86
विश्वसनीयता 10.0 10.0
संगति 9.7 8.8
सही परीक्षण
प्रति प्रयास पास दर 57.6% 51.5%
अस्थिर टेस्ट 1 3
कुल रन 66 66
प्रति परिणाम लागत 5.502 0.928
कुल लागत $0.661 $0.093
इनपुट कीमत $3.000 / 1M $0.250 / 1M
आउटपुट कीमत $15.000 / 1M $0.750 / 1M
कुल इनपुट टोकन 123,264 109,572
आउटपुट टोकन 19,362 10,313
रीजनिंग टोकन 0 76,806
प्रतिक्रिया समय (औसत) 8.12s 2.72s
प्रतिक्रिया समय (अधिकतम) 51.18s 14.63s
प्रतिक्रिया समय (कुल) 121.78s 57.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#86 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

त्वरित तुलना

तुलना जोड़ी बदलें