AI BENCHY Compare

OpenAI: GPT-5.5 vs xAI: Grok 4.20

خلاصہ

GPT-5.5 vs Grok 4.20 benchmark موازنہ: GPT-5.5 average score میں آگے ہے: 9.3 vs 4.4. Grok 4.20 کی benchmark لاگت کم ہے: $0.057 vs $0.907. Grok 4.20 تیز ہے: 1.11s vs 9.76s، pass rates 85.7% vs 28.6%.

تجویز کردہ ماڈل: GPT-5.5 - It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 2 models.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-02

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Grok 4.20 Grok 4.20 none اجرا: 2026-03-31

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Grok 4.20 Grok 4.20 none اجرا: 2026-03-31
اسکور	9.3	4.4
درجہ	#4	#160
اعتماد پذیری	10.0	دستیاب نہیں
تسلسل	10.0	8.5
درست ٹیسٹس
فی کوشش کامیابی کی شرح	85.7%	28.6%
غیر مستحکم ٹیسٹ	0	0
کل رنز	63	54
فی نتیجہ لاگت	5.035	1.570
کل لاگت	$0.907	$0.057
ان پٹ قیمت	$5.000 / 1M	$1.250 / 1M
آؤٹ پٹ قیمت	$30.000 / 1M	$2.500 / 1M
کل ان پٹ ٹوکنز	34,209	41,313
آؤٹ پٹ ٹوکنز	2,046	1,923
ریزننگ ٹوکنز	22,460	0
ردِعمل کا وقت (اوسط)	9.76s	1.11s
ردِعمل کا وقت (زیادہ سے زیادہ)	56.19s	6.04s
ردِعمل کا وقت (کل)	204.92s	19.96s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

لاگت: $0.068
وقت: 37.0s
ٹوکنز: 2,339 tok

#160 xAI: Grok 4.20

none

لاگت: $0.004
وقت: 6.5s
ٹوکنز: 1,367 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

کوڈنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Grok 4.20	1.1	3.1	0.0%	0		1.22s	1,074	312	0

مشترکہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

ڈیٹا پارسنگ اور استخراج	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

ڈومین مخصوص	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

عمومی ذہانت	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

ہدایات کی پیروی	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

پہیلی حل کرنا	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

ٹول کالنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

معلومات عامہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Grok 4.20	0.0	0.0	0.0%	0		0ms	0	0	0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں

GPT-5.5lowvsQwen3.7 Maxmedium Grok 4.20nonevsGLM 4.7 Flashmedium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.5 FlashmediumvsGPT-5.5low Gemini 3 Flash PreviewmediumvsGPT-5.5low Qwen3 Coder NextmediumvsGrok 4.20none MiniMax M2.5mediumvsGrok 4.20none GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low Gemini 3.5 FlashhighvsGPT-5.5low CobuddymediumvsGrok 4.20none