নেভিগেশন
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.2 Chat

সারাংশ

Claude Opus 4.8 (medium) average score-এ এগিয়ে: 8.8 vs 8.5. GPT-5.2 Chat-এর benchmark খরচ কম: $0.393 vs $1.107. GPT-5.2 Chat দ্রুত: 7.13s vs 9.72s, pass rates 84.1% vs 74.6%.

প্রস্তাবিত মডেলGPT-5.2 ChatIts score stays close to the best score here (8.5 vs 8.8), while costing about 2.8x less than Claude Opus 4.8 (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-14

মেট্রিক Claude Opus 4.8 Claude Opus 4.8 medium প্রকাশ: 2026-05-28 GPT-5.2 Chat GPT-5.2 Chat none প্রকাশ: 2025-12-11
স্কোর 8.8 8.5
র‍্যাঙ্ক #15 #22
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.6 8.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 84.1% 74.6%
অস্থির টেস্ট 1 3
মোট রান 63 63
প্রতি ফলাফলে খরচ 6.512 2.803
মোট খরচ $1.107 $0.393
ইনপুট মূল্য $5.000 / 1M $1.750 / 1M
আউটপুট মূল্য $25.000 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 61,007 34,212
আউটপুট টোকেন 26,495 23,744
রিজনিং টোকেন 5,901 0
প্রতিক্রিয়া সময় (গড়) 9.72s 7.13s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 38.03s 38.52s
প্রতিক্রিয়া সময় (মোট) 204.19s 149.69s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.8

medium
খরচ
$0.057
সময়
23.1s
টোকেন
2,412 tok

#22 GPT-5.2 Chat

none
খরচ
$0.010
সময়
15.3s
টোকেন
797 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0

দ্রুত তুলনা

তুলনার জুটি বদলান