AI BENCHY Compare

Qwen: Qwen3.7 Max vs Xiaomi: MiMo-V2-Pro

Last updated at: 2026-05-22

Metric	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18

Metric	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18
Score	7.9	7.6
Rank	#26	#44
Reliability	10.0	9.5
Consistency	10.0	7.9
Tests Correct
Attempt pass rate	70.0%	76.7%
Flaky tests	0	5
Total Runs	60	60
Cost per result	0.719	2.453
Total Cost	$0.101	$0.295
Input Price	$2.500 / 1M	$1.000 / 1M
Output Price	$7.500 / 1M	$3.000 / 1M
Output Tokens	1,988	2,556
Reasoning Tokens	0	81,879
Response Time (avg)	1.30s	22.19s
Response Time (max)	3.92s	136.29s
Response Time (total)	25.95s	443.77s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		2.86s	251	1,154

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0
MiMo-V2-Pro	7.5	6.0	83.3%	1		94.21s	527	37,424

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0
MiMo-V2-Pro	5.3	10.0	33.3%	0		8.82s	170	2,158

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.92s	184	400

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0
MiMo-V2-Pro	6.4	4.4	77.8%	2		5.26s	410	1,700

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0
MiMo-V2-Pro	3.0	10.0	0.0%	0		82.71s	28	15,842

Quick Compare

Switch Comparison Pair

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemma 4 31BmediumFree AvailablevsQwen3.7 Maxnone Qwen3.7 MaxnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium Seed-2.0-LitemediumvsQwen3.7 Maxnone Gemini 3.1 Flash LitelowvsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone