নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.4 Nano

সারাংশ

GPT-5.4 Nano (medium) average score-এ এগিয়ে: 7.5 vs 7.3. GPT-5.4 Nano (medium)-এর benchmark খরচ কম: $0.107 vs $0.316. Claude Sonnet 4.6 দ্রুত: 5.04s vs 11.95s, pass rates 55.6% vs 63.5%.

প্রস্তাবিত মডেলGPT-5.4 Nano (medium)It has the best score here (7.5), while costing about 3.0x less than Claude Sonnet 4.6.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-14

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 GPT-5.4 Nano GPT-5.4 Nano medium প্রকাশ: 2026-03-17
স্কোর 7.3 7.5
র‍্যাঙ্ক #71 #62
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 8.4
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 55.6% 63.5%
অস্থির টেস্ট 1 4
মোট রান 63 63
প্রতি ফলাফলে খরচ 2.870 0.969
মোট খরচ $0.316 $0.107
ইনপুট মূল্য $3.000 / 1M $0.200 / 1M
আউটপুট মূল্য $15.000 / 1M $1.250 / 1M
মোট ইনপুট টোকেন 57,886 35,434
আউটপুট টোকেন 9,465 3,014
রিজনিং টোকেন 0 76,520
প্রতিক্রিয়া সময় (গড়) 5.04s 11.95s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 23.84s 94.06s
প্রতিক্রিয়া সময় (মোট) 70.60s 250.98s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#62 GPT-5.4 Nano

medium
খরচ
$0.007
সময়
24.6s
টোকেন
4,943 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
GPT-5.4 Nano 6.1 4.7 66.7% 2 19.12s 7,305 516 20,778

দ্রুত তুলনা

তুলনার জুটি বদলান