নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

তুলনা করা মডেল

Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium) benchmark তুলনা: Gemini 3.1 Pro Preview (medium) স্কোর-এ 9.2 নিয়ে এগিয়ে। Claude Opus 4.6 (medium) নির্ভরযোগ্যতা-এ 10.0 নিয়ে এগিয়ে। GPT-5.3-Codex (medium)-এর মোট খরচ সবচেয়ে কম, $0.920. GPT-5.3-Codex (medium) 16.96s-এ সবচেয়ে দ্রুত।

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-07

র‍্যাঙ্ক
#60
মোট আউটপুট টোকেন
100,601
প্রতিক্রিয়া সময় (গড়)
34.27s
মোট খরচ
$3.059
র‍্যাঙ্ক
#56
মোট আউটপুট টোকেন
115,865
প্রতিক্রিয়া সময় (গড়)
25.91s
মোট খরচ
$2.057
র‍্যাঙ্ক
#18
মোট আউটপুট টোকেন
55,525
প্রতিক্রিয়া সময় (গড়)
16.96s
মোট খরচ
$0.920
র‍্যাঙ্ক
#9
মোট আউটপুট টোকেন
97,958
প্রতিক্রিয়া সময় (গড়)
21.47s
মোট খরচ
$1.361
প্রস্তাবিত মডেল GPT-5.3-Codex (medium)

Its score stays close to the best score here (8.9 vs 9.2), while costing about 2.3x less than এই তুলনার অন্য মডেলগুলো.

বিস্তারিত তুলনা

মেট্রিক Claude Opus 4.6 Claude Opus 4.6 medium প্রকাশ: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium প্রকাশ: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium প্রকাশ: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium প্রকাশ: 2026-02-19
স্কোর 7.7 7.8 8.9 9.2
র‍্যাঙ্ক #60 #56 #18 #9
নির্ভরযোগ্যতা 10.0 10.0 10.0 10.0
ধারাবাহিকতা 8.8 9.2 8.6 10.0
বেঞ্চমার্ক কভারেজ 22/22 টেস্ট · 66/66 প্রচেষ্টা 22/22 টেস্ট · 66/66 প্রচেষ্টা 22/22 টেস্ট · 66/66 প্রচেষ্টা 22/22 টেস্ট · 66/66 প্রচেষ্টা
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 63.6% 66.7% 83.3% 90.9%
অস্থির টেস্ট 3 2 4 0
মোট রান 66 66 66 66
প্রতি ফলাফলে খরচ 23.524 14.692 5.748 6.801
মোট খরচ $3.059 $2.057 $0.920 $1.361
ইনপুট মূল্য $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
আউটপুট মূল্য $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
মোট ইনপুট টোকেন 108,615 106,292 81,268 92,287
আউটপুট টোকেন 72,286 80,748 6,251 5,232
রিজনিং টোকেন 28,315 35,117 49,274 92,726
প্রতিক্রিয়া সময় (গড়) 34.27s 25.91s 16.96s 21.47s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 151.51s 140.96s 100.93s 88.68s
প্রতিক্রিয়া সময় (মোট) 513.99s 362.78s 373.19s 322.08s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#56 Claude Sonnet 4.6

medium
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#18 GPT-5.3-Codex

medium
খরচ
$0.049
সময়
54.9s
টোকেন
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
খরচ
$0.115
সময়
87.2s
টোকেন
9,629 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

দ্রুত তুলনা

তুলনার জুটি বদলান