AI BENCHY Compare

OpenAI: GPT-5.2 vs xAI: Grok 4.20

Last updated at: 2026-04-02

Metric	GPT-5.2 GPT-5.2 medium Release: 2025-12-11	Grok 4.20 Grok 4.20 medium Release: 2026-03-31

Metric	GPT-5.2 GPT-5.2 medium Release: 2025-12-11	Grok 4.20 Grok 4.20 medium Release: 2026-03-31
Score	7.3	7.1
Rank	#36	#40
Consistency	8.0	8.2
Tests Correct
Attempt pass rate	70.6%	66.7%
Flaky tests	4	4
Total Runs	51	51
Cost per result	3.131	7.358
Total Cost	$0.314	$0.663
Input Price	$1.750 / 1M	$2.000 / 1M
Output Price	$14.000 / 1M	$6.000 / 1M
Output Tokens	2,238	1,494
Reasoning Tokens	16,811	97,078
Response Time (avg)	13.93s	9.50s
Response Time (max)	77.80s	29.87s
Response Time (total)	139.29s	161.54s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002
Grok 4.20	8.2	7.9	83.3%	1		3.36s	280	8,476

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269
Grok 4.20	5.8	2.8	66.7%	1		7.09s	47	4,252

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614
Grok 4.20	7.3	5.9	83.3%	1		4.42s	40	5,474

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	7.7	7.3	77.8%	1		5.47s	609	938
Grok 4.20	6.4	7.7	55.6%	1		3.89s	143	8,028

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Quick Compare

Switch Comparison Pair

Claude Sonnet 4.6nonevsGPT-5.2medium Claude Sonnet 4.6nonevsGrok 4.20medium Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium Gemma 4 31BnonevsGrok 4.20medium Grok 4.20mediumvsGLM 5none GPT-5.3 ChatnonevsGrok 4.20medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium GPT-5.2mediumvsQwen3.5 Plus 2026-02-15none Gemma 4 31BnonevsGPT-5.2medium GPT-5.2mediumvsGLM 5none Grok 4.20mediumvsMiMo-V2-Omninone GPT-5.2 ChatnonevsGrok 4.20medium