AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

সারাংশ

Claude Opus 4.8 vs GPT-5.5 benchmark তুলনা: GPT-5.5 average score-এ এগিয়ে: 9.0 vs 7.2. Claude Opus 4.8-এর benchmark খরচ কম: $0.539 vs $3.679. Claude Opus 4.8 দ্রুত: 3.47s vs 37.98s, pass rates 61.9% vs 87.3%.

প্রস্তাবিত মডেল: Claude Opus 4.8 - It offers the best overall trade-off: a competitive score (7.2), lower cost than GPT-5.5, and balanced response time.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-06-18

মেট্রিক	Claude Opus 4.8 Claude Opus 4.8 none প্রকাশ: 2026-05-28	GPT-5.5 GPT-5.5 medium প্রকাশ: 2026-04-24

মেট্রিক	Claude Opus 4.8 Claude Opus 4.8 none প্রকাশ: 2026-05-28	GPT-5.5 GPT-5.5 medium প্রকাশ: 2026-04-24
স্কোর	7.2	9.0
র‍্যাঙ্ক	#57	#9
নির্ভরযোগ্যতা	10.0	10.0
ধারাবাহিকতা	9.2	8.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট	61.9%	87.3%
অস্থির টেস্ট	2	3
মোট রান	63	63
প্রতি ফলাফলে খরচ	4.485	21.638
মোট খরচ	$0.539	$3.679
ইনপুট মূল্য	$5.000 / 1M	$5.000 / 1M
আউটপুট মূল্য	$25.000 / 1M	$30.000 / 1M
মোট ইনপুট টোকেন	67,104	34,212
আউটপুট টোকেন	8,107	1,985
রিজনিং টোকেন	0	114,925
প্রতিক্রিয়া সময় (গড়)	3.47s	37.98s
প্রতিক্রিয়া সময় (সর্বোচ্চ)	17.73s	332.10s
প্রতিক্রিয়া সময় (মোট)	72.90s	797.60s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#57 Claude Opus 4.8

none

খরচ: $0.053
সময়: 22.0s
টোকেন: 2,253 tok

#9 GPT-5.5

medium

খরচ: $0.112
সময়: 71.9s
টোকেন: 3,807 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

অ্যান্টি-এআই কৌশল	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	834	1,472	0
GPT-5.5	10.0	10.0	100.0%	0		4.66s	606	250	1,335

কোডিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	5.5	10.0	33.3%	0		3.29s	10,590	1,332	0
GPT-5.5	8.8	7.8	88.9%	1		59.77s	7,305	362	24,959

সমন্বিত	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	29,658	3,259	0
GPT-5.5	10.0	10.0	100.0%	0		19.29s	11,019	312	2,841

ডেটা পার্সিং ও নিষ্কাশন	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	10,503	308	0
GPT-5.5	10.0	10.0	100.0%	0		4.18s	7,140	234	593

ডোমেইন-নির্দিষ্ট	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	975	61	0
GPT-5.5	5.3	7.2	44.4%	1		164.14s	723	67	79,625

Sadharon Buddhimotta	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	708	230	0
GPT-5.5	10.0	10.0	100.0%	0		4.16s	477	138	223

নির্দেশনা অনুসরণ	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	909	95	0
GPT-5.5	10.0	10.0	100.0%	0		3.36s	660	93	538

ধাঁধা সমাধান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	894	783	0
GPT-5.5	10.0	10.0	100.0%	0		6.76s	642	241	2,225

টুল কলিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	11,775	355	0
GPT-5.5	10.0	10.0	100.0%	0		10.57s	5,445	258	832

সাধারণ জ্ঞান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	258	212	0
GPT-5.5	2.8	1.6	33.3%	1		37.86s	195	30	1,754

দ্রুত তুলনা

তুলনার জুটি বদলান