AI BENCHY Compare

OpenAI: GPT-5 Nano vs xAI: Grok 4.20

Last updated at: 2026-04-02

Metric	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07	Grok 4.20 Grok 4.20 none Release: 2026-03-31

Metric	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07	Grok 4.20 Grok 4.20 none Release: 2026-03-31
Score	6.2	5.4
Rank	#52	#69
Consistency	6.7	9.5
Tests Correct
Attempt pass rate	58.8%	31.4%
Flaky tests	7	1
Total Runs	51	51
Cost per result	0.864	1.809
Total Cost	$0.061	$0.091
Input Price	$0.050 / 1M	$2.000 / 1M
Output Price	$0.400 / 1M	$6.000 / 1M
Output Tokens	4,500	1,655
Reasoning Tokens	143,296	0
Response Time (avg)	44.47s	1.11s
Response Time (max)	204.02s	6.04s
Response Time (total)	444.74s	18.80s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	6.5	7.9	58.3%	1		25.50s	1,221	21,184
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	3.7	1.7	50.0%	2		21.42s	453	10,560
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	5.2	4.4	55.6%	2		204.02s	237	64,448
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	4.1	10.0	0.0%	0		17.51s	202	4,608
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	8.5	6.8	83.3%	1		11.90s	382	4,096
Grok 4.20	4.8	10.0	0.0%	0		455ms	60	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	5.3	7.2	44.4%	1		19.81s	869	13,440
Grok 4.20	5.3	7.4	44.4%	1		487ms	242	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

Quick Compare

Switch Comparison Pair

DeepSeek V3.2nonevsGPT-5 Nanomedium GPT-5 NanomediumvsMiMo-V2-Omninone Mistral Small 4mediumvsGrok 4.20none GPT-5 NanomediumvsQwen3.5-Flashnone GPT-5 NanomediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGPT-5 Nanomedium Gemini 2.5 FlashnonevsGPT-5 Nanomedium MiniMax M2.7mediumvsGrok 4.20none GPT-5 NanomediumvsQwen3.5-35B-A3Bnone GPT-5 NanomediumvsHunter Alphanone GPT-5 NanomediumvsQwen3.5-122B-A10Bnone GPT-5 NanomediumvsGLM 5none