AI BENCHY तुलना

OpenAI: GPT-5.4 Mini vs xAI: Grok 4.20 Multi-Agent Beta

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-03-17

मेट्रिक	GPT-5.4 Mini GPT-5.4 Mini none रिलीज़: 2026-03-17	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium रिलीज़: 2026-03-12

मेट्रिक	GPT-5.4 Mini GPT-5.4 Mini none रिलीज़: 2026-03-17	Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium रिलीज़: 2026-03-12
रैंक	#66	#44
स्कोर	4.8	6.2
संगति	8.6	7.2
प्रति परिणाम लागत	0.737	82.962
कुल लागत	$0.030	$4.978
सही परीक्षण
प्रति प्रयास पास दर	31.4%	54.9%
अस्थिर टेस्ट	3	6
कुल रन	51	51
आउटपुट टोकन	2,085	298,948
रीजनिंग टोकन	0	296,529
प्रतिक्रिया समय (औसत)	1.17s	8.64s
प्रतिक्रिया समय (अधिकतम)	2.52s	35.28s
प्रतिक्रिया समय (कुल)	19.82s	129.64s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	3.1	8.1	8.3%	1		929ms	654	0
Grok 4.20 Multi-Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.52s	298	0
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.30s	222	0
Grok 4.20 Multi-Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	3.5	4.4	33.3%	2		937ms	88	0
Grok 4.20 Multi-Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	4.8	10.0	0.0%	0		1.82s	174	0
Grok 4.20 Multi-Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	6.3	10.0	50.0%	0		728ms	101	0
Grok 4.20 Multi-Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322

Puzzle Solving	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	5.4	10.0	33.3%	0		860ms	293	0
Grok 4.20 Multi-Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.32s	255	0
Grok 4.20 Multi-Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

त्वरित तुलना

तुलना जोड़ी बदलें

GPT-5.4 MininonevsQwen3 Coder Nextmedium DeepSeek V3.2nonevsGrok 4.20 Multi-Agent Betamedium GPT-5.4 MininonevsGLM 4.7 Flashmedium Qwen3.5-FlashnonevsGrok 4.20 Multi-Agent Betamedium Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium Gemini 2.5 FlashnonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-35B-A3BnonevsGrok 4.20 Multi-Agent Betamedium GPT-5.4 MininonevsQwen3.5-9Bmedium Hunter AlphanonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-122B-A10BnonevsGrok 4.20 Multi-Agent Betamedium Grok 4.20 Multi-Agent BetamediumvsGLM 5none Qwen3.5 Plus 2026-02-15nonevsGrok 4.20 Multi-Agent Betamedium