নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs xAI: Grok 4.5

Claude Opus 4.8 (medium) average score-এ এগিয়ে: 8.8 vs 8.4. Grok 4.5 (low)-এর benchmark খরচ কম: $0.935 vs $1.931. Claude Opus 4.8 (medium) দ্রুত: 12.49s vs 15.56s, pass rates 84.9% vs 75.8%.

প্রস্তাবিত মডেলClaude Opus 4.8 (medium)It has the strongest score in this comparison (8.8) and the best overall balance of cost and response time across all 2 models.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-21

মেট্রিক Claude Opus 4.8 Claude Opus 4.8 medium প্রকাশ: 2026-05-28 Grok 4.5 Grok 4.5 low প্রকাশ: 2026-07-08
স্কোর 8.8 8.4
র‍্যাঙ্ক #17 #23
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.6 9.7
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 84.9% 75.8%
অস্থির টেস্ট 1 1
মোট রান 66 66
প্রতি ফলাফলে খরচ 10.724 5.844
মোট খরচ $1.931 $0.935
ইনপুট মূল্য $5.000 / 1M $2.000 / 1M
আউটপুট মূল্য $25.000 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 138,451 125,596
আউটপুট টোকেন 40,766 7,505
রিজনিং টোকেন 9,075 106,446
প্রতিক্রিয়া সময় (গড়) 12.49s 15.56s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 70.54s 205.28s
প্রতিক্রিয়া সময় (মোট) 274.72s 342.32s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#17 Claude Opus 4.8

medium
খরচ
$0.057
সময়
23.1s
টোকেন
2,412 tok

#23 xAI: Grok 4.5

low
খরচ
$0.011
সময়
12.4s
টোকেন
2,018 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Grok 4.5 10.0 10.0 100.0% 0 13.72s 9,579 303 15,641

দ্রুত তুলনা

তুলনার জুটি বদলান