AI BENCHY Compare

Elephant vs xAI: Grok 4.20

Last updated at: 2026-04-14

Metric	Elephant Elephant none Release: 2026-04-14	Grok 4.20 Grok 4.20 medium Release: 2026-03-31

Metric	Elephant Elephant none Release: 2026-04-14	Grok 4.20 Grok 4.20 medium Release: 2026-03-31
Score	5.2	7.0
Rank	#81	#44
Consistency	9.6	7.8
Tests Correct
Attempt pass rate	31.5%	66.7%
Flaky tests	1	5
Total Runs	54	54
Cost per result	0.000	8.252
Total Cost	$0.000	$0.743
Input Price	$0.000 / 1M	$2.000 / 1M
Output Price	$0.000 / 1M	$6.000 / 1M
Output Tokens	2,573	1,744
Reasoning Tokens	0	109,882
Response Time (avg)	1.23s	10.33s
Response Time (max)	3.81s	29.87s
Response Time (total)	22.16s	185.87s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	6.6	10.0	50.0%	0		963ms	610	0
Grok 4.20	8.2	7.9	83.3%	1		3.36s	280	8,476

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	6.4	3.3	66.7%	1		1.39s	375	0
Grok 4.20	4.3	1.1	66.7%	1		24.33s	250	12,804

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	3.0	10.0	0.0%	0		3.81s	731	0
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	6.5	10.0	50.0%	0		1.04s	246	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	3.0	10.0	0.0%	0		927ms	24	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	4.0	10.0	0.0%	0		854ms	106	0
Grok 4.20	5.8	2.8	66.7%	1		7.09s	47	4,252

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	9.8	10.0	100.0%	0		1.03s	81	0
Grok 4.20	7.3	5.9	83.3%	1		4.42s	40	5,474

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	3.3	10.0	0.0%	0		849ms	170	0
Grok 4.20	6.4	7.7	55.6%	1		3.89s	143	8,028

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Elephant	3.0	10.0	0.0%	0		2.79s	230	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Quick Compare

Switch Comparison Pair

Gemma 4 31BnoneFree AvailablevsGrok 4.20medium MiniMax M2.7mediumvsElephantnone Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium Grok 4.20mediumvsGLM 5none Claude Sonnet 4.6nonevsGrok 4.20medium Mistral Small 4mediumvsElephantnone ElephantnonevsQwen3 Coder Nextmedium MiniMax M2.5mediumFree AvailablevsElephantnone Grok 4.20mediumvsMiMo-V2-Omninone ElephantnonevsGLM 4.7 Flashmedium gpt-oss-120bmediumFree AvailablevsElephantnone GPT-5.3 ChatnonevsGrok 4.20medium