DeepSeek V4 Pro (high) vs Grok Build 0.1 (medium)

Recommended model DeepSeek V4 Pro (high)

It has the best score here (7.7), while costing about 5.5x less than Grok Build 0.1 (medium).

Detailed comparison

Metric	DeepSeek V4 Pro DeepSeek V4 Pro high Release: 2026-04-24	Grok Build 0.1 Grok Build 0.1 medium Release: 2026-05-21

Metric	DeepSeek V4 Pro DeepSeek V4 Pro high Release: 2026-04-24	Grok Build 0.1 Grok Build 0.1 medium Release: 2026-05-21
Score	7.7	7.6
Rank	#58	#60
Reliability	10.0	10.0
Consistency	7.7	10.0
Tests Correct
Attempt pass rate	63.6%	63.6%
Flaky tests	6	0
Total Runs	66	66
Cost per result	2.000	7.830
Total Cost	$0.200	$1.097
Input Price	$0.435 / 1M	$1.000 / 1M
Output Price	$0.870 / 1M	$2.000 / 1M
Total Input Tokens	90,748	106,751
Output Tokens	10,462	7,993
Reasoning Tokens	178,719	486,670
Response Time (avg)	79.14s	52.06s
Response Time (max)	416.76s	252.69s
Response Time (total)	1740.97s	1145.27s

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

high

medium

Category:

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	5.7	5.9	58.3%	2		25.70s	536	149	3,214
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	6.3	8.7	33.3%	0		243.00s	5,090	383	84,580
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		78.99s	66,082	4,582	25,404
Grok Build 0.1	10.0	10.0	100.0%	0		65.08s	75,242	5,442	65,569

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		25.03s	7,690	274	2,166
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.6	7.2	22.2%	1		151.46s	569	4,404	50,391
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		8.83s	471	115	1,013
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	7.8	6.6	83.3%	1		8.73s	627	66	2,726
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	6.9	4.9	77.8%	2		56.85s	591	178	2,563
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	9.8	10.0	100.0%	0		15.92s	8,909	295	701
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.0	10.0	0.0%	0		34.01s	183	16	5,961
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

Switch Comparison Pair