AI BENCHY Compare

Qwen: Qwen3.5 Plus 2026-02-15 vs xAI: Grok 4.20

Last updated at: 2026-05-10

Metric	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Release: 2026-02-15	Grok 4.20 Grok 4.20 medium Release: 2026-03-31

Metric	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Release: 2026-02-15	Grok 4.20 Grok 4.20 medium Release: 2026-03-31
Score	6.5	6.9
Rank	#78	#68
Reliability	10.0	10.0
Consistency	9.3	8.3
Tests Correct
Attempt pass rate	50.9%	63.2%
Flaky tests	2	4
Total Runs	57	57
Cost per result	0.183	7.559
Total Cost	$0.017	$0.756
Input Price	$0.260 / 1M	$1.250 / 1M
Output Price	$1.560 / 1M	$2.500 / 1M
Output Tokens	2,472	1,784
Reasoning Tokens	0	128,233
Response Time (avg)	2.49s	14.53s
Response Time (max)	6.65s	63.48s
Response Time (total)	32.33s	276.06s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	4.8	10.0	25.0%	0		1.91s	517	0
Grok 4.20	8.2	7.9	83.3%	1		3.95s	287	8,312

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	6.3	3.7	33.3%	1		3.63s	443	0
Grok 4.20	4.3	1.1	66.7%	1		24.33s	250	12,804

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		6.65s	314	0
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.89s	243	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		1.17s	17	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	4.4	3.0	33.3%	1		2.26s	117	0
Grok 4.20	3.9	2.6	33.3%	1		24.48s	65	6,440

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0
Grok 4.20	7.3	6.0	83.3%	1		4.42s	40	5,474

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	7.7	10.0	66.7%	0		2.82s	516	0
Grok 4.20	7.7	10.0	66.7%	0		6.20s	149	7,913

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		1.11s	11	0
Grok 4.20	3.0	10.0	0.0%	0		63.48s	9	16,442

Quick Compare

Switch Comparison Pair

DeepSeek V4 ProhighvsGrok 4.20medium Gemma 4 31BnoneFree AvailablevsGrok 4.20medium Gemini 3.1 Flash LiteminimalvsGrok 4.20medium Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium GPT-5.5nonevsGrok 4.20medium Gemini 3.1 Flash LitenonevsGrok 4.20medium Mercury 2mediumvsQwen3.5 Plus 2026-02-15none Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash LiteminimalvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5 Plus 2026-02-15none DeepSeek V4 ProhighvsQwen3.5 Plus 2026-02-15none