নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs GPT-5.3 Chat

GPT-5.3 Chat average score-এ এগিয়ে: 7.5 vs 7.0. Mercury 2 (medium)-এর benchmark খরচ কম: $0.093 vs $0.571. Mercury 2 (medium) দ্রুত: 2.72s vs 6.88s, pass rates 51.5% vs 68.2%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

র‍্যাঙ্ক
#86
মোট আউটপুট টোকেন
87,119
প্রতিক্রিয়া সময় (গড়)
2.72s
মোট খরচ
$0.093
র‍্যাঙ্ক
#62
মোট আউটপুট টোকেন
30,854
প্রতিক্রিয়া সময় (গড়)
6.88s
মোট খরচ
$0.571
প্রস্তাবিত মডেল Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.5), while costing about 6.1x less than GPT-5.3 Chat.

বিস্তারিত তুলনা

মেট্রিক Mercury 2 Mercury 2 medium প্রকাশ: 2026-02-24 GPT-5.3 Chat GPT-5.3 Chat none প্রকাশ: 2026-03-03
স্কোর 7.0 7.5
র‍্যাঙ্ক #86 #62
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.8 8.2
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 51.5% 68.2%
অস্থির টেস্ট 3 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.928 4.387
মোট খরচ $0.093 $0.571
ইনপুট মূল্য $0.250 / 1M $1.750 / 1M
আউটপুট মূল্য $0.750 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 109,572 78,990
আউটপুট টোকেন 10,313 30,854
রিজনিং টোকেন 76,806 0
প্রতিক্রিয়া সময় (গড়) 2.72s 6.88s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 14.63s 18.33s
প্রতিক্রিয়া সময় (মোট) 57.12s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#86 Mercury 2

medium
খরচ
$0.002
সময়
2.1s
টোকেন
1,702 tok

#62 GPT-5.3 Chat

none
খরচ
$0.008
সময়
8.1s
টোকেন
634 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

দ্রুত তুলনা

তুলনার জুটি বদলান