AI BENCHY Compare

Qwen: Qwen3.5 Plus 2026-02-15 vs Xiaomi: MiMo-V2-Pro

Last updated at: 2026-03-20

Metric	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Release: 2026-02-15	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18

Metric	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Release: 2026-02-15	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18
Score	6.8	8.0
Rank	#40	#20
Consistency	9.6	8.5
Tests Correct
Attempt pass rate	54.9%	76.5%
Flaky tests	1	3
Total Runs	51	45
Cost per result	0.172	1.110
Total Cost	$0.016	$0.123
Input Price	$0.260 / 1M	$1.000 / 1M
Output Price	$1.560 / 1M	$3.000 / 1M
Output Tokens	2,018	1,875
Reasoning Tokens	0	26,959
Response Time (avg)	2.51s	9.78s
Response Time (max)	6.65s	64.71s
Response Time (total)	27.60s	156.45s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	4.8	10.0	25.0%	0		1.91s	517	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		3.06s	223	1,107

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		6.65s	314	0
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.89s	243	0
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		1.17s	17	0
MiMo-V2-Pro	5.3	10.0	33.3%	0		6.00s	155	1,048

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	4.4	3.0	33.3%	1		2.26s	117	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.06s	198	424

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	7.7	10.0	66.7%	0		2.82s	516	0
MiMo-V2-Pro	7.0	7.2	55.6%	1		4.71s	313	1,179

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none Nemotron 3 SupermediumFree AvailablevsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none GPT-5.4 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5.3 ChatnonevsMiMo-V2-Promedium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Mercury 2mediumvsQwen3.5 Plus 2026-02-15none