AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs MiniMax: MiniMax M3

Summary

DeepSeek V4 Pro vs MiniMax M3 benchmark comparison: MiniMax M3 leads on average score with 7.6 vs 7.2. DeepSeek V4 Pro has the lower benchmark cost at $0.034 vs $0.131. DeepSeek V4 Pro is faster at 6.41s vs 68.17s, with pass rates of 52.4% vs 65.1%.

Recommended model: DeepSeek V4 Pro - Its score stays close to the best score here (7.2 vs 7.6), while costing about 3.9x less than MiniMax M3.

Last updated at: 2026-07-02

Metric	DeepSeek V4 Pro DeepSeek V4 Pro none Release: 2026-04-24	MiniMax M3 MiniMax M3 medium Release: 2026-06-01

Metric	DeepSeek V4 Pro DeepSeek V4 Pro none Release: 2026-04-24	MiniMax M3 MiniMax M3 medium Release: 2026-06-01
Score	7.2	7.6
Rank	#60	#42
Reliability	9.9	9.6
Consistency	8.8	7.9
Tests Correct
Attempt pass rate	52.4%	65.1%
Flaky tests	3	5
Total Runs	63	63
Cost per result	0.333	1.187
Total Cost	$0.034	$0.131
Input Price	$0.435 / 1M	$0.300 / 1M
Output Price	$0.870 / 1M	$1.200 / 1M
Total Input Tokens	53,558	46,546
Output Tokens	11,424	49,036
Reasoning Tokens	0	92,543
Response Time (avg)	6.41s	68.17s
Response Time (max)	30.09s	431.03s
Response Time (total)	134.66s	1363.38s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 DeepSeek V4 Pro

none

Invalid SVG

Cost: $0.000
Time: 300.0s
Tokens: 0 tok

#42 MiniMax M3

medium

Cost: $0.012
Time: 154.4s
Tokens: 10,018 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.2	6.1	16.7%	2		4.02s	540	1,168	0
MiniMax M3	5.5	3.7	66.7%	3		14.95s	2,526	874	3,414

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	5.6	10.0	33.3%	0		13.38s	7,275	5,500	0
MiniMax M3	6.1	6.5	55.6%	1		144.74s	5,804	6,223	32,667

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	9.5	10.0	100.0%	0		23.74s	27,529	2,235	0
MiniMax M3	10.0	10.0	100.0%	0		65.30s	14,760	1,306	6,253

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		4.61s	7,568	200	0
MiniMax M3	10.0	10.0	100.0%	0		14.92s	8,088	514	3,164

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	5.3	10.0	33.3%	0		3.72s	666	24	0
MiniMax M3	5.5	9.3	33.3%	0		233.13s	869	16,254	19,070

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	5.0	10.0	0.0%	0		2.05s	471	126	0
MiniMax M3	5.1	3.4	33.3%	1		33.25s	954	2,487	2,523

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	6.3	5.8	66.7%	1		4.12s	627	713	0
MiniMax M3	9.8	10.0	100.0%	0		6.14s	1,623	103	920

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		3.61s	594	442	0
MiniMax M3	7.9	9.9	66.7%	0		49.91s	2,079	11,946	13,761

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		7.40s	8,105	328	0
MiniMax M3	10.0	10.0	100.0%	0		11.91s	9,168	281	555

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.0	10.0	0.0%	0		5.76s	183	688	0
MiniMax M3	3.0	10.0	0.0%	0		100.80s	675	9,048	10,216

Quick Compare

Switch Comparison Pair

DeepSeek V4 PrononevsGemma 4 26B A4BmediumFree Available DeepSeek V4 ProhighvsMiniMax M3medium MiniMax M3mediumvsStep 3.7 Flashlow DeepSeek V4 PrononevsStep 3.7 Flashhigh DeepSeek V4 PrononevsGLM 5.1medium MiniMax M3mediumvsGPT-5.3 Chatnone Claude Opus 4.8lowvsMiniMax M3medium DeepSeek V4 PrononevsLaguna XS 2.1mediumFree Available DeepSeek V4 PrononevsKimi K2.7 Codemedium DeepSeek V4 PrononevsGrok 4.20medium DeepSeek V4 PrononevsGemini 3 Flash Previewlow DeepSeek V4 PrononevsMiMo-V2.5-Promedium