AI BENCHY तुलना

OpenAI: GPT-5.4 vs xAI: Grok 4.20

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-04-02

मेट्रिक	GPT-5.4 GPT-5.4 none रिलीज़: 2026-03-05	Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31

मेट्रिक	GPT-5.4 GPT-5.4 none रिलीज़: 2026-03-05	Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर	5.6	5.4
रैंक	#64	#69
संगति	9.0	9.5
सही परीक्षण
प्रति प्रयास पास दर	39.2%	31.4%
अस्थिर टेस्ट	2	1
कुल रन	51	51
प्रति परिणाम लागत	1.573	1.809
कुल लागत	$0.095	$0.091
???? ???	$2.500 / 1M	$2.000 / 1M
????? ???	$15.000 / 1M	$6.000 / 1M
आउटपुट टोकन	1,837	1,655
रीजनिंग टोकन	0	0
प्रतिक्रिया समय (औसत)	1.43s	1.11s
प्रतिक्रिया समय (अधिकतम)	2.89s	6.04s
प्रतिक्रिया समय (कुल)	24.27s	18.80s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	3.2	8.0	8.3%	1		1.21s	406	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	3.0	10.0	0.0%	0		2.89s	291	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	10.0	10.0	100.0%	0		1.04s	222	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	5.3	7.2	44.4%	1		1.07s	50	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	4.4	9.9	0.0%	0		1.78s	184	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	6.5	10.0	50.0%	0		1.07s	81	0
Grok 4.20	4.8	10.0	0.0%	0		455ms	60	0

Puzzle Solving	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	5.6	9.8	33.3%	0		1.52s	357	0
Grok 4.20	5.3	7.4	44.4%	1		487ms	242	0

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

त्वरित तुलना

तुलना जोड़ी बदलें

Mistral Small 4mediumvsGPT-5.4none Mistral Small 4mediumvsGrok 4.20none MiniMax M2.5mediumनिःशुल्क उपलब्धvsGPT-5.4none MiniMax M2.7mediumvsGrok 4.20none MiniMax M2.5mediumनिःशुल्क उपलब्धvsGrok 4.20none Qwen3 Coder NextmediumvsGrok 4.20none GPT-5.4nonevsGrok 4.20 Multi Agent Betamedium gpt-oss-120bmediumनिःशुल्क उपलब्धvsGrok 4.20none MiniMax M2.7mediumvsGPT-5.4none Mercury 2mediumvsGPT-5.4none Grok 4.20nonevsGLM 4.7 Flashmedium GPT-5.4nonevsQwen3 Coder Nextmedium