AI BENCHY Compare

OpenAI: GPT-5.5 vs xAI: Grok Build 0.1

সারাংশ

GPT-5.5 vs Grok Build 0.1 benchmark তুলনা: GPT-5.5 average score-এ এগিয়ে: 9.3 vs 7.6. GPT-5.5-এর benchmark খরচ কম: $0.907 vs $0.927. GPT-5.5 দ্রুত: 9.76s vs 49.90s, pass rates 85.7% vs 61.9%.

প্রস্তাবিত মডেল: GPT-5.5 - It has the best score here (9.3), while responding about 5.1x faster than Grok Build 0.1.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-02

মেট্রিক	GPT-5.5 GPT-5.5 low প্রকাশ: 2026-04-24	Grok Build 0.1 Grok Build 0.1 medium প্রকাশ: 2026-05-21

মেট্রিক	GPT-5.5 GPT-5.5 low প্রকাশ: 2026-04-24	Grok Build 0.1 Grok Build 0.1 medium প্রকাশ: 2026-05-21
স্কোর	9.3	7.6
র‍্যাঙ্ক	#4	#44
নির্ভরযোগ্যতা	10.0	10.0
ধারাবাহিকতা	10.0	9.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট	85.7%	61.9%
অস্থির টেস্ট	0	0
মোট রান	63	63
প্রতি ফলাফলে খরচ	5.035	7.124
মোট খরচ	$0.907	$0.927
ইনপুট মূল্য	$5.000 / 1M	$1.000 / 1M
আউটপুট মূল্য	$30.000 / 1M	$2.000 / 1M
মোট ইনপুট টোকেন	34,209	44,418
আউটপুট টোকেন	2,046	2,782
রিজনিং টোকেন	22,460	438,018
প্রতিক্রিয়া সময় (গড়)	9.76s	49.90s
প্রতিক্রিয়া সময় (সর্বোচ্চ)	56.19s	252.69s
প্রতিক্রিয়া সময় (মোট)	204.92s	1047.92s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

খরচ: $0.068
সময়: 37.0s
টোকেন: 2,339 tok

#44 xAI: Grok Build 0.1

medium

খরচ: $0.028
সময়: 81.3s
টোকেন: 14,009 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

অ্যান্টি-এআই কৌশল	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

কোডিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

সমন্বিত	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	12,909	231	16,917

ডেটা পার্সিং ও নিষ্কাশন	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

ডোমেইন-নির্দিষ্ট	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

Sadharon Buddhimotta	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

নির্দেশনা অনুসরণ	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

ধাঁধা সমাধান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

টুল কলিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

সাধারণ জ্ঞান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

দ্রুত তুলনা

তুলনার জুটি বদলান

DeepSeek V4 ProhighvsGrok Build 0.1medium GPT-5.5lowvsQwen3.7 Maxmedium GPT-5.3 ChatnonevsGrok Build 0.1medium Step 3.7 FlashlowvsGrok Build 0.1medium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Claude Opus 4.8lowvsGrok Build 0.1medium Gemini 3.5 FlashmediumvsGPT-5.5low Gemini 3 Flash PreviewlowvsGrok Build 0.1medium Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Sonnet 4.6nonevsGrok Build 0.1medium Claude Opus 4.8nonevsGrok Build 0.1medium