AI BENCHY Compare

Qwen: Qwen3.5-9B vs xAI: Grok 4.1 Fast

Last updated at: 2026-03-12

Metric	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02	Grok 4.1 Fast Grok 4.1 Fast medium Release: 2025-11-19

Metric	Qwen3.5-9B Qwen3.5-9B none Release: 2026-03-02	Grok 4.1 Fast Grok 4.1 Fast medium Release: 2025-11-19
Rank	#60	#32
Avg Score	3.4	6.2
Consistency	10.0	7.9
Cost per result	0.111	0.563
Total Cost	$0.005	$0.051
Tests Correct
Attempt pass rate	25.0%	66.7%
Flaky tests	0	4
Total Runs	48	48
Output Tokens	2,939	1,183
Reasoning Tokens	0	83,875
Response Time (avg)	1.06s	26.35s
Response Time (max)	5.91s	121.79s
Response Time (total)	16.95s	237.11s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Total Output Tokens

Avg Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	10.0	9.9	0.0%	0		1.02s	576	0
Grok 4.1 Fast	10.0	10.0	100.0%	0		5.65s	102	4,021

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	10.0	10.0	0.0%	0		5.91s	1,255	0
Grok 4.1 Fast	10.0	10.0	100.0%	0		37.64s	261	12,272

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	9.9	10.0	100.0%	0		847ms	249	0
Grok 4.1 Fast	9.9	10.0	100.0%	0		6.63s	180	5,409

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	10.0	10.0	0.0%	0		464ms	24	0
Grok 4.1 Fast	4.0	4.4	66.7%	2		121.79s	11	37,657

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	3.0	9.9	0.0%	0		552ms	99	0
Grok 4.1 Fast	3.0	9.9	0.0%	0		16.25s	127	3,456

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	5.5	10.0	50.0%	0		514ms	75	0
Grok 4.1 Fast	5.5	10.0	50.0%	0		5.30s	55	3,489

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	10.0	9.9	0.0%	0		683ms	388	0
Grok 4.1 Fast	4.0	7.2	44.4%	1		8.08s	187	6,086

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0
Grok 4.1 Fast	10.0	1.6	33.3%	1		27.71s	260	11,485

Quick Compare

Switch Comparison Pair

Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Grok 4.1 FastmediumvsGLM 5none Qwen3.5-9BnonevsGLM 4.7 Flashmedium Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium DeepSeek V3.2nonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewnonevsGrok 4.1 Fastmedium Qwen3.5-FlashnonevsGrok 4.1 Fastmedium Gemini 2.5 FlashnonevsGrok 4.1 Fastmedium Gemini 3 Flash PreviewnonevsGrok 4.1 Fastmedium GPT-5.3 ChatnonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewlowvsGrok 4.1 Fastmedium Qwen3.5-122B-A10BnonevsGrok 4.1 Fastmedium