নেভিগেশন
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.3-Codex

সারাংশ

GPT-5.3-Codex (medium) average score-এ এগিয়ে: 8.9 vs 7.3. Claude Sonnet 4.6-এর benchmark খরচ কম: $0.316 vs $0.740. Claude Sonnet 4.6 দ্রুত: 5.04s vs 16.22s, pass rates 55.6% vs 82.5%.

প্রস্তাবিত মডেলGPT-5.3-Codex (medium)It has the strongest score in this comparison (8.9) and the best overall balance of cost and response time across all 2 models.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-14

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium প্রকাশ: 2026-02-05
স্কোর 7.3 8.9
র‍্যাঙ্ক #71 #13
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 8.5
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 55.6% 82.5%
অস্থির টেস্ট 1 4
মোট রান 63 63
প্রতি ফলাফলে খরচ 2.870 4.932
মোট খরচ $0.316 $0.740
ইনপুট মূল্য $3.000 / 1M $1.750 / 1M
আউটপুট মূল্য $15.000 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 57,886 34,299
আউটপুট টোকেন 9,465 2,357
রিজনিং টোকেন 0 46,189
প্রতিক্রিয়া সময় (গড়) 5.04s 16.22s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 23.84s 100.93s
প্রতিক্রিয়া সময় (মোট) 70.60s 340.67s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#13 GPT-5.3-Codex

medium
খরচ
$0.049
সময়
54.9s
টোকেন
3,580 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890

দ্রুত তুলনা

তুলনার জুটি বদলান