AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs Qwen: Qwen3.5-122B-A10B

Summary

DeepSeek V4 Pro vs Qwen3.5-122B-A10B benchmark comparison: Qwen3.5-122B-A10B leads on average score with 7.7 vs 7.6. DeepSeek V4 Pro has the lower benchmark cost at $0.157 vs $0.588. Qwen3.5-122B-A10B is faster at 42.49s vs 77.20s, with pass rates of 66.7% vs 73.0%.

Recommended model: DeepSeek V4 Pro - Its score stays close to the best score here (7.6 vs 7.7), while costing about 3.7x less than Qwen3.5-122B-A10B.

Last updated at: 2026-06-17

Metric	DeepSeek V4 Pro DeepSeek V4 Pro high Release: 2026-04-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Release: 2026-02-24

Metric	DeepSeek V4 Pro DeepSeek V4 Pro high Release: 2026-04-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Release: 2026-02-24
Score	7.6	7.7
Rank	#41	#36
Reliability	9.3	10.0
Consistency	7.0	8.8
Tests Correct
Attempt pass rate	66.7%	73.0%
Flaky tests	8	3
Total Runs	63	63
Cost per result	1.742	5.235
Total Cost	$0.157	$0.588
Input Price	$0.435 / 1M	$0.260 / 1M
Output Price	$0.870 / 1M	$2.080 / 1M
Total Input Tokens	38,726	41,832
Output Tokens	6,334	26,187
Reasoning Tokens	159,151	251,028
Response Time (avg)	77.20s	42.49s
Response Time (max)	416.76s	168.16s
Response Time (total)	1621.17s	892.30s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#41 DeepSeek V4 Pro

high

Cost: $0.023
Time: 257.6s
Tokens: 14,870 tok

#36 Qwen3.5-122B-A10B

medium

Cost: $0.019
Time: 48.7s
Tokens: 6,034 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	5.7	5.9	58.3%	2		25.70s	536	149	3,214
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.75s	672	269	16,835

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	6.1	4.6	66.7%	2		243.00s	5,090	383	84,580
Qwen3.5-122B-A10B	6.0	7.2	55.6%	1		114.48s	7,630	8,057	82,578

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		38.17s	14,060	454	5,836
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		107.79s	14,947	483	11,337

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		25.03s	7,690	274	2,166
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		23.41s	7,782	270	16,558

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.6	7.2	22.2%	1		151.46s	569	4,404	50,391
Qwen3.5-122B-A10B	2.9	7.2	11.1%	1		63.40s	771	15,537	64,889

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	10.0	10.0	100.0%	0		8.83s	471	115	1,013
Qwen3.5-122B-A10B	3.4	2.2	33.3%	1		34.11s	344	66	7,592

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	7.8	6.6	83.3%	1		8.73s	627	66	2,726
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.88s	593	77	7,372

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	6.9	4.9	77.8%	2		56.85s	591	178	2,563
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		17.89s	696	284	27,575

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	9.8	10.0	100.0%	0		15.92s	8,909	295	701
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		4.60s	8,193	322	1,226

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
DeepSeek V4 Pro	3.0	10.0	0.0%	0		34.01s	183	16	5,961
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		52.87s	204	822	15,066

Quick Compare

Switch Comparison Pair

DeepSeek V4 ProhighvsMiniMax M3medium DeepSeek V4 ProhighvsGrok Build 0.1medium Qwen3.5-122B-A10BmediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsKimi K2.5medium DeepSeek V4 ProhighvsMercury 2medium DeepSeek V4 ProhighvsStep 3.7 Flashlow Claude Opus 4.6mediumvsDeepSeek V4 Prohigh DeepSeek V4 ProhighvsGPT-5.3 Chatnone DeepSeek V4 ProhighvsGPT-5.4 Nanomedium DeepSeek V4 ProhighvsGrok 4.3medium DeepSeek V4 ProhighvsQwen3.6 Flashmedium DeepSeek V4 ProhighvsKimi K2.6mediumFree Available