নেভিগেশন
AI BENCHY
Advertise here

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.3-Codex

GPT-5.3-Codex (medium) average score-এ এগিয়ে: 8.9 vs 7.3. Claude Sonnet 4.6-এর benchmark খরচ কম: $0.661 vs $0.920. Claude Sonnet 4.6 দ্রুত: 8.12s vs 16.96s, pass rates 57.6% vs 83.3%.

প্রস্তাবিত মডেলGPT-5.3-Codex (medium)It has the strongest score in this comparison (8.9) and the best overall balance of cost and response time across all 2 models.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium প্রকাশ: 2026-02-05
স্কোর 7.3 8.9
র‍্যাঙ্ক #71 #18
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 8.6
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 57.6% 83.3%
অস্থির টেস্ট 1 4
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.502 5.748
মোট খরচ $0.661 $0.920
ইনপুট মূল্য $3.000 / 1M $1.750 / 1M
আউটপুট মূল্য $15.000 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 123,264 81,268
আউটপুট টোকেন 19,362 6,251
রিজনিং টোকেন 0 49,274
প্রতিক্রিয়া সময় (গড়) 8.12s 16.96s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 51.18s 100.93s
প্রতিক্রিয়া সময় (মোট) 121.78s 373.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#18 GPT-5.3-Codex

medium
খরচ
$0.049
সময়
54.9s
টোকেন
3,580 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890

দ্রুত তুলনা

তুলনার জুটি বদলান