AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs xAI: Grok 4.20

Last updated at: 2026-04-02

Metric	GPT-5.4 Mini GPT-5.4 Mini medium Release: 2026-03-17	Grok 4.20 Grok 4.20 medium Release: 2026-03-31

Metric	GPT-5.4 Mini GPT-5.4 Mini medium Release: 2026-03-17	Grok 4.20 Grok 4.20 medium Release: 2026-03-31
Score	7.1	7.1
Rank	#41	#40
Consistency	7.2	8.2
Tests Correct
Attempt pass rate	68.6%	66.7%
Flaky tests	6	4
Total Runs	51	51
Cost per result	3.610	7.358
Total Cost	$0.289	$0.663
Input Price	$0.750 / 1M	$2.000 / 1M
Output Price	$4.500 / 1M	$6.000 / 1M
Output Tokens	1,708	1,494
Reasoning Tokens	58,019	97,078
Response Time (avg)	15.66s	9.50s
Response Time (max)	102.91s	29.87s
Response Time (total)	266.14s	161.54s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	296	2,876
Grok 4.20	8.2	7.9	83.3%	1		3.36s	280	8,476

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	317	4,317
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	234	650
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	60	43,286
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	150	510
Grok 4.20	5.8	2.8	66.7%	1		7.09s	47	4,252

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	7.4	6.5	66.7%	1		2.50s	129	1,337
Grok 4.20	7.3	5.9	83.3%	1		4.42s	40	5,474

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	6.8	7.9	55.6%	1		4.33s	271	2,449
Grok 4.20	6.4	7.7	55.6%	1		3.89s	143	8,028

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	251	2,594
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Quick Compare

Switch Comparison Pair

Claude Sonnet 4.6nonevsGrok 4.20medium Claude Sonnet 4.6nonevsGPT-5.4 Minimedium GPT-5.4 MinimediumvsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium Gemma 4 31BnonevsGPT-5.4 Minimedium GPT-5.4 MinimediumvsGLM 5none Gemma 4 31BnonevsGrok 4.20medium Grok 4.20mediumvsGLM 5none GPT-5.3 ChatnonevsGrok 4.20medium GPT-5.4 MinimediumvsMiMo-V2-Omninone Grok 4.20mediumvsMiMo-V2-Omninone GPT-5.2 ChatnonevsGrok 4.20medium