AI BENCHY Compare

DeepSeek: DeepSeek V4 Flash vs Qwen: Qwen3.7 Max

Summary

DeepSeek V4 Flash vs Qwen3.7 Max benchmark comparison: Qwen3.7 Max leads on average score with 9.4 vs 8.3. DeepSeek V4 Flash has the lower benchmark cost at $0.029 vs $0.523. Qwen3.7 Max is faster at 16.02s vs 45.85s, with pass rates of 74.6% vs 88.9%.

Recommended model: DeepSeek V4 Flash - It offers the best overall trade-off: a competitive score (8.3), lower cost than Qwen3.7 Max, and balanced response time.

Last updated at: 2026-06-12

Metric	DeepSeek V4 Flash DeepSeek V4 Flash high Release: 2026-04-24	Qwen3.7 Max Qwen3.7 Max medium Release: 2026-05-22

Metric	DeepSeek V4 Flash DeepSeek V4 Flash high Release: 2026-04-24	Qwen3.7 Max Qwen3.7 Max medium Release: 2026-05-22
Score	8.3	9.4
Rank	#26	#4
Reliability	10.0	10.0
Consistency	8.5	9.6
Tests Correct
Attempt pass rate	74.6%	88.9%
Flaky tests	4	1
Total Runs	63	63
Cost per result	0.299	5.517
Total Cost	$0.029	$0.523
Input Price	$0.098 / 1M	$1.250 / 1M
Output Price	$0.196 / 1M	$3.750 / 1M
Total Input Tokens	39,745	42,360
Output Tokens	10,310	2,129
Reasoning Tokens	123,501	122,959
Response Time (avg)	45.85s	16.02s
Response Time (max)	218.13s	59.98s
Response Time (total)	962.79s	336.51s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 DeepSeek V4 Flash

high

Cost: $0.003
Time: 93.1s
Tokens: 7,926 tok

#4 Qwen3.7 Max

medium

Cost: $0.017
Time: 68.8s
Tokens: 4,526 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	8.3	10.0	75.0%	0		28.51s	540	140	7,770
Qwen3.7 Max	10.0	10.0	100.0%	0		6.36s	672	222	8,742

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	7.8	10.0	66.7%	0		50.60s	7,279	395	34,862
Qwen3.7 Max	10.0	10.0	100.0%	0		35.31s	7,893	423	34,808

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	10.0	10.0	100.0%	0		76.57s	14,016	465	7,347
Qwen3.7 Max	10.0	10.0	100.0%	0		19.60s	14,934	366	8,405

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	10.0	10.0	100.0%	0		28.03s	7,290	201	1,179
Qwen3.7 Max	10.0	10.0	100.0%	0		8.80s	7,782	270	6,254

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	4.1	4.4	44.5%	2		100.31s	666	27	59,249
Qwen3.7 Max	5.9	7.2	55.6%	1		24.94s	771	61	31,793

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	6.1	3.1	66.7%	1		25.15s	471	79	632
Qwen3.7 Max	10.0	10.0	100.0%	0		11.70s	516	135	4,457

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	10.0	10.0	100.0%	0		15.36s	627	63	1,622
Qwen3.7 Max	10.0	10.0	100.0%	0		7.46s	699	102	5,452

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	8.2	7.2	88.9%	1		26.11s	594	196	1,767
Qwen3.7 Max	10.0	10.0	100.0%	0		8.84s	696	259	8,908

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	10.0	10.0	100.0%	0		74.73s	8,079	228	542
Qwen3.7 Max	10.0	10.0	100.0%	0		6.63s	8,193	267	1,220

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Flash	3.0	10.0	0.0%	0		54.46s	183	8,516	8,531
Qwen3.7 Max	3.0	10.0	0.0%	0		33.37s	204	24	12,920

Quick Compare

Switch Comparison Pair