নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs Inception: Mercury 2

Claude Sonnet 4.6 average score-এ এগিয়ে: 7.3 vs 7.0. Mercury 2 (medium)-এর benchmark খরচ কম: $0.093 vs $0.661. Mercury 2 (medium) দ্রুত: 2.72s vs 8.12s, pass rates 57.6% vs 51.5%.

প্রস্তাবিত মডেলMercury 2 (medium)Its score stays close to the best score here (7.0 vs 7.3), while costing about 7.1x less than Claude Sonnet 4.6.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 Mercury 2 Mercury 2 medium প্রকাশ: 2026-02-24
স্কোর 7.3 7.0
র‍্যাঙ্ক #71 #86
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 8.8
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 57.6% 51.5%
অস্থির টেস্ট 1 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.502 0.928
মোট খরচ $0.661 $0.093
ইনপুট মূল্য $3.000 / 1M $0.250 / 1M
আউটপুট মূল্য $15.000 / 1M $0.750 / 1M
মোট ইনপুট টোকেন 123,264 109,572
আউটপুট টোকেন 19,362 10,313
রিজনিং টোকেন 0 76,806
প্রতিক্রিয়া সময় (গড়) 8.12s 2.72s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 51.18s 14.63s
প্রতিক্রিয়া সময় (মোট) 121.78s 57.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#86 Mercury 2

medium
খরচ
$0.002
সময়
2.1s
টোকেন
1,702 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328

দ্রুত তুলনা

তুলনার জুটি বদলান