AI BENCHY तुलना

OpenAI: GPT-5.3 Chat vs xAI: Grok 4.20 Beta

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-03-12

मेट्रिक	GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03	Grok 4.20 Beta Grok 4.20 Beta medium रिलीज़: 2026-03-12

मेट्रिक	GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03	Grok 4.20 Beta Grok 4.20 Beta medium रिलीज़: 2026-03-12
रैंक	#20	#24
औसत स्कोर	7.3	7.0
संगति	8.5	9.0
प्रति परिणाम लागत	3.163	5.989
कुल लागत	$0.317	$0.599
सही परीक्षण
प्रति प्रयास पास दर	70.8%	70.8%
अस्थिर टेस्ट	3	2
कुल रन	48	48
आउटपुट टोकन	19,272	1,481
रीजनिंग टोकन	0	86,628
प्रतिक्रिया समय (औसत)	5.96s	8.89s
प्रतिक्रिया समय (अधिकतम)	18.33s	24.21s
प्रतिक्रिया समय (कुल)	95.30s	142.18s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

औसत स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

औसत स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	7.3	7.5	77.8%	1		4.72s	3,091	0
Grok 4.20 Beta	7.0	7.2	88.9%	1		3.19s	262	6,289

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0
Grok 4.20 Beta	10.0	10.0	100.0%	0		20.93s	227	12,212

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	9.9	10.0	100.0%	0		2.21s	942	0
Grok 4.20 Beta	9.9	10.0	100.0%	0		4.01s	180	5,281

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	4.4	33.3%	2		13.01s	8,264	0
Grok 4.20 Beta	4.0	10.0	33.3%	0		21.33s	251	40,255

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	4.0	10.0	0.0%	0		1.99s	319	0
Grok 4.20 Beta	10.0	10.0	100.0%	0		5.78s	72	3,440

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	9.0	10.0	50.0%	0		3.29s	1,455	0
Grok 4.20 Beta	9.0	10.0	50.0%	0		4.97s	57	7,107

Puzzle Solving	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0
Grok 4.20 Beta	7.0	7.2	88.9%	1		3.85s	249	6,660

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0
Grok 4.20 Beta	10.0	10.0	0.0%	0		12.39s	183	5,384

त्वरित तुलना

तुलना जोड़ी बदलें

DeepSeek V3.2mediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewnonevsGrok 4.20 Betamedium GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Gemini 2.5 FlashmediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGLM 5medium GPT-5.3 ChatnonevsStep 3.5 Flashmediumनिःशुल्क उपलब्ध Gemini 3 Flash PreviewnonevsGrok 4.20 Betamedium Claude Sonnet 4.6nonevsGrok 4.20 Betamedium Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewlowvsGrok 4.20 Betamedium Seed-2.0-MinimediumvsGPT-5.3 Chatnone