AI BENCHY Compare

Compared models

Last updated at: 2026-04-04

Metric	Hunter Alpha Hunter Alpha medium Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18	Hunter Alpha Hunter Alpha none Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro none Release: 2026-03-18

Metric	Hunter Alpha Hunter Alpha medium Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Release: 2026-03-18	Hunter Alpha Hunter Alpha none Release: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro none Release: 2026-03-18
Score	7.0	8.0	5.9	5.8
Rank	#43	#24	#63	#65
Consistency	7.2	8.5	8.1	8.5
Tests Correct
Attempt pass rate	68.6%	76.5%	49.0%	45.1%
Flaky tests	6	3	4	3
Total Runs	51	45	51	51
Cost per result	0.000	1.110	0.000	0.659
Total Cost	$0.000	$0.123	$0.000	$0.040
Input Price	$0.000 / 1M	$1.000 / 1M	$0.000 / 1M	$1.000 / 1M
Output Price	$0.000 / 1M	$3.000 / 1M	$0.000 / 1M	$3.000 / 1M
Output Tokens	4,724	1,875	2,278	1,721
Reasoning Tokens	17,921	26,959	0	0
Response Time (avg)	10.33s	9.78s	4.58s	2.31s
Response Time (max)	30.53s	64.71s	15.17s	6.58s
Response Time (total)	175.60s	156.45s	77.92s	39.25s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	7.3	5.8	83.3%	2		4.75s	479	1,103
MiMo-V2-Pro	10.0	10.0	100.0%	0		3.06s	223	1,107
Hunter Alpha	3.5	8.0	16.7%	1		3.81s	779	0
MiMo-V2-Pro	3.5	8.0	16.7%	1		1.80s	315	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	4.7	1.6	66.7%	1		30.53s	792	3,456
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186
Hunter Alpha	3.0	10.0	0.0%	0		15.17s	379	0
MiMo-V2-Pro	3.0	10.0	0.0%	0		6.58s	333	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	10.0	10.0	100.0%	0		23.16s	1,488	8,017
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484
Hunter Alpha	10.0	10.0	100.0%	0		8.49s	249	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		1.39s	249	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	3.0	10.0	0.0%	0		10.52s	892	2,406
MiMo-V2-Pro	5.3	10.0	33.3%	0		6.00s	155	1,048
Hunter Alpha	5.3	10.0	33.3%	0		2.33s	27	0
MiMo-V2-Pro	5.3	7.2	44.4%	1		1.78s	26	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	7.0	3.7	66.7%	1		6.44s	116	260
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.06s	198	424
Hunter Alpha	6.1	3.1	66.7%	1		2.71s	91	0
MiMo-V2-Pro	4.3	9.9	0.0%	0		2.44s	125	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	9.9	10.0	100.0%	0		4.18s	208	465
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667
Hunter Alpha	6.4	10.0	50.0%	0		2.82s	69	0
MiMo-V2-Pro	6.5	10.0	50.0%	0		2.51s	69	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	6.1	4.7	66.7%	2		5.36s	441	1,310
MiMo-V2-Pro	7.0	7.2	55.6%	1		4.71s	313	1,179
Hunter Alpha	5.8	4.4	66.7%	2		3.06s	349	0
MiMo-V2-Pro	6.0	7.1	55.6%	1		1.83s	327	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Hunter Alpha	10.0	10.0	100.0%	0		17.33s	308	904
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864
Hunter Alpha	10.0	10.0	100.0%	0		6.02s	335	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.39s	277	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumFree AvailablevsHunter Alphanone Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium MiniMax M2.5mediumFree AvailablevsMiMo-V2-Pronone gpt-oss-120bmediumFree AvailablevsHunter Alphanone Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Mistral Small 4mediumvsMiMo-V2-Pronone Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none gpt-oss-120bmediumFree AvailablevsMiMo-V2-Pronone Gemma 4 31BnonevsHunter Alphamedium Hunter AlphamediumvsGLM 5none