নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.3 Chat

Claude Opus 4.6 (medium) average score-এ এগিয়ে: 7.7 vs 7.5. GPT-5.3 Chat-এর benchmark খরচ কম: $0.571 vs $3.059. GPT-5.3 Chat দ্রুত: 6.88s vs 34.27s, pass rates 63.6% vs 68.2%.

প্রস্তাবিত মডেলGPT-5.3 ChatIts score stays close to the best score here (7.5 vs 7.7), while costing about 5.4x less than Claude Opus 4.6 (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

মেট্রিক Claude Opus 4.6 Claude Opus 4.6 medium প্রকাশ: 2026-02-05 GPT-5.3 Chat GPT-5.3 Chat none প্রকাশ: 2026-03-03
স্কোর 7.7 7.5
র‍্যাঙ্ক #50 #62
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.8 8.2
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 63.6% 68.2%
অস্থির টেস্ট 3 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 23.524 4.387
মোট খরচ $3.059 $0.571
ইনপুট মূল্য $5.000 / 1M $1.750 / 1M
আউটপুট মূল্য $25.000 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 108,615 78,990
আউটপুট টোকেন 72,286 30,854
রিজনিং টোকেন 28,315 0
প্রতিক্রিয়া সময় (গড়) 34.27s 6.88s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 151.51s 18.33s
প্রতিক্রিয়া সময় (মোট) 513.99s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#50 Claude Opus 4.6

medium
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#62 GPT-5.3 Chat

none
খরচ
$0.008
সময়
8.1s
টোকেন
634 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

দ্রুত তুলনা

তুলনার জুটি বদলান