AI BENCHY Compare

Compared models

Last updated at: 2026-04-04

Metric	Hunter Alpha Hunter Alpha medium Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18	MiMo-V2-Omni MiMo-V2-Omni medium Release: 2026-03-18

Metric	Hunter Alpha Hunter Alpha medium Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18	MiMo-V2-Omni MiMo-V2-Omni medium Release: 2026-03-18
Score	7.0	8.0	7.9
Rank	#43	#24	#26
Consistency	7.2	8.5	10.0
Tests Correct
Attempt pass rate	68.6%	76.5%	64.7%
Flaky tests	6	3	0
Total Runs	51	45	17
Cost per result	0.000	1.110	0.763
Total Cost	$0.000	$0.123	$0.084
Input Price	$0.000 / 1M	$1.000 / 1M	$0.400 / 1M
Output Price	$0.000 / 1M	$3.000 / 1M	$2.000 / 1M
Output Tokens	4,724	1,875	663
Reasoning Tokens	17,921	26,959	39,001
Response Time (avg)	10.33s	9.78s	13.71s
Response Time (max)	30.53s	64.71s	158.78s
Response Time (total)	175.60s	156.45s	233.06s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	7.3	5.8	83.3%	2		4.75s	479	1,103
MiMo-V2-Pro	10.0	10.0	100.0%	0		3.06s	223	1,107
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.11s	112	402

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	4.7	1.6	66.7%	1		30.53s	792	3,456
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186
MiMo-V2-Omni	10.0	10.0	100.0%	0		19.29s	131	2,807

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	10.0	10.0	100.0%	0		23.16s	1,488	8,017
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.29s	87	323

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	3.0	10.0	0.0%	0		10.52s	892	2,406
MiMo-V2-Pro	5.3	10.0	33.3%	0		6.00s	155	1,048
MiMo-V2-Omni	3.0	10.0	0.0%	0		55.12s	13	33,279

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	7.0	3.7	66.7%	1		6.44s	116	260
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.06s	198	424
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.86s	58	202

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	9.9	10.0	100.0%	0		4.18s	208	465
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667
MiMo-V2-Omni	8.3	10.0	50.0%	0		4.92s	35	201

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	6.1	4.7	66.7%	2		5.36s	441	1,310
MiMo-V2-Pro	7.0	7.2	55.6%	1		4.71s	313	1,179
MiMo-V2-Omni	6.5	10.0	33.3%	0		3.88s	126	481

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	10.0	10.0	100.0%	0		17.33s	308	904
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864
MiMo-V2-Omni	10.0	10.0	100.0%	0		11.07s	101	1,306

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium Gemini 3 Flash PreviewnonevsMiMo-V2-Omnimedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Omnimedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Omnimedium GPT-5.2 ChatnonevsMiMo-V2-Omnimedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none Gemma 4 31BnonevsHunter Alphamedium Hunter AlphamediumvsGLM 5none Claude Sonnet 4.6nonevsHunter Alphamedium