AI BENCHY तुलना

OpenAI: GPT-5.3 Chat vs xAI: Grok 4.3

सारांश

GPT-5.3 Chat vs Grok 4.3 benchmark तुलना: Grok 4.3 average score में आगे है: 7.7 vs 7.5. GPT-5.3 Chat की benchmark लागत कम है: $0.433 vs $0.614. GPT-5.3 Chat तेज है: 6.34s vs 47.51s, pass rates 66.7% vs 71.4%.

अनुशंसित मॉडल: GPT-5.3 Chat - Its score stays close to the best score here (7.5 vs 7.7), while responding about 7.5x faster than Grok 4.3.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-12

मेट्रिक	GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03	Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01

मेट्रिक	GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03	Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर	7.5	7.7
रैंक	#47	#40
विश्वसनीयता	10.0	10.0
संगति	8.1	8.5
सही परीक्षण
प्रति प्रयास पास दर	66.7%	71.4%
अस्थिर टेस्ट	5	4
कुल रन	63	63
प्रति परिणाम लागत	3.605	4.724
कुल लागत	$0.433	$0.614
इनपुट कीमत	$1.750 / 1M	$1.250 / 1M
आउटपुट कीमत	$14.000 / 1M	$2.500 / 1M
कुल इनपुट टोकन	34,209	44,472
आउटपुट टोकन	26,617	1,981
रीजनिंग टोकन	0	221,382
प्रतिक्रिया समय (औसत)	6.34s	47.51s
प्रतिक्रिया समय (अधिकतम)	18.33s	216.69s
प्रतिक्रिया समय (कुल)	133.13s	997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#47 GPT-5.3 Chat

none

Cost: $0.008
Time: 8.1s
Tokens: 634 tok

#40 xAI: Grok 4.3

medium

Cost: $0.009
Time: 19.0s
Tokens: 3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	606	3,167	0
Grok 4.3	10.0	10.0	100.0%	0		8.83s	2,010	88	8,207

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	5.6	4.7	55.6%	2		10.52s	7,302	6,632	0
Grok 4.3	5.9	7.7	44.4%	1		41.23s	8,340	1,028	31,226

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	11,019	2,614	0
Grok 4.3	10.0	10.0	100.0%	0		63.99s	12,909	234	15,301

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	7,140	942	0
Grok 4.3	10.0	10.0	100.0%	0		18.97s	7,761	180	9,546

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	723	8,264	0
Grok 4.3	5.3	7.2	44.4%	1		181.74s	1,764	14	111,300

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	477	319	0
Grok 4.3	5.4	2.5	66.7%	1		24.70s	825	70	5,020

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	9.8	10.0	100.0%	0		3.51s	660	1,491	0
Grok 4.3	9.8	10.0	100.0%	0		18.58s	1,362	57	8,713

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.99s	642	1,758	0
Grok 4.3	5.9	7.2	55.6%	1		22.52s	1,689	128	14,468

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	5,445	861	0
Grok 4.3	10.0	10.0	100.0%	0		17.66s	7,263	168	4,615

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.3 Chat	3.0	10.0	0.0%	0		4.38s	195	569	0
Grok 4.3	3.0	10.0	0.0%	0		44.47s	549	14	12,986

त्वरित तुलना

तुलना जोड़ी बदलें

Step 3.7 FlashlowvsGrok 4.3medium Mercury 2mediumvsGPT-5.3 Chatnone Kimi K2.5mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.6 Flashmedium DeepSeek V3.2mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok Build 0.1medium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2.5-Promedium MiniMax M3mediumvsGPT-5.3 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok 4.20medium GPT-5.3 ChatnonevsStep 3.7 Flashlow