AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.5

সারাংশ

Claude Opus 4.6 vs GPT-5.5 benchmark তুলনা: GPT-5.5 average score-এ এগিয়ে: 9.3 vs 7.7. GPT-5.5-এর benchmark খরচ কম: $0.907 vs $2.053. GPT-5.5 দ্রুত: 9.76s vs 25.89s, pass rates 61.9% vs 85.7%.

প্রস্তাবিত মডেল: GPT-5.5 - It has the best score here (9.3), while costing about 2.3x less than Claude Opus 4.6.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-02

মেট্রিক	Claude Opus 4.6 Claude Opus 4.6 medium প্রকাশ: 2026-02-05	GPT-5.5 GPT-5.5 low প্রকাশ: 2026-04-24

মেট্রিক	Claude Opus 4.6 Claude Opus 4.6 medium প্রকাশ: 2026-02-05	GPT-5.5 GPT-5.5 low প্রকাশ: 2026-04-24
স্কোর	7.7	9.3
র‍্যাঙ্ক	#40	#4
নির্ভরযোগ্যতা	10.0	10.0
ধারাবাহিকতা	8.8	10.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট	61.9%	85.7%
অস্থির টেস্ট	3	0
মোট রান	63	63
প্রতি ফলাফলে খরচ	17.103	5.035
মোট খরচ	$2.053	$0.907
ইনপুট মূল্য	$5.000 / 1M	$5.000 / 1M
আউটপুট মূল্য	$25.000 / 1M	$30.000 / 1M
মোট ইনপুট টোকেন	53,227	34,209
আউটপুট টোকেন	47,446	2,046
রিজনিং টোকেন	24,000	22,460
প্রতিক্রিয়া সময় (গড়)	25.89s	9.76s
প্রতিক্রিয়া সময় (সর্বোচ্চ)	83.40s	56.19s
প্রতিক্রিয়া সময় (মোট)	362.49s	204.92s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#40 Claude Opus 4.6

medium

অবৈধ SVG

খরচ: $0.000
সময়: 300.0s
টোকেন: 0 tok

#4 GPT-5.5

low

খরচ: $0.068
সময়: 37.0s
টোকেন: 2,339 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

অ্যান্টি-এআই কৌশল	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	840	986	1,071
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

কোডিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	5.7	7.1	44.4%	1		30.10s	8,522	13,057	4,121
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

সমন্বিত	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	20,685	8,178	5,194
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

ডেটা পার্সিং ও নিষ্কাশন	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	8,676	691	757
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

ডোমেইন-নির্দিষ্ট	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	674	14,642	8,687
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Sadharon Buddhimotta	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	564	188	292
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

নির্দেশনা অনুসরণ	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	792	266	467
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

ধাঁধা সমাধান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	7.7	10.0	66.7%	0		4.71s	816	532	630
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

টুল কলিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	11,454	861	329
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

সাধারণ জ্ঞান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
Claude Opus 4.6	3.0	10.0	0.0%	0		63.24s	204	8,045	2,452
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

দ্রুত তুলনা

তুলনার জুটি বদলান

Claude Opus 4.6mediumvsStep 3.7 Flashlow GPT-5.5lowvsQwen3.7 Maxmedium Claude Opus 4.6mediumvsDeepSeek V4 Prohigh Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Claude Opus 4.6mediumvsGPT-5.3 Chatnone Gemini 3.5 FlashmediumvsGPT-5.5low Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Opus 4.6mediumvsGemini 3 Flash Previewlow GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low Gemini 3.5 FlashhighvsGPT-5.5low