AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Xiaomi: MiMo-V2-Omni

Last updated at: 2026-05-01

Metric	Claude Opus 4.6 Claude Opus 4.6 medium Release: 2026-02-05	MiMo-V2-Omni MiMo-V2-Omni medium Release: 2026-03-18

Metric	Claude Opus 4.6 Claude Opus 4.6 medium Release: 2026-02-05	MiMo-V2-Omni MiMo-V2-Omni medium Release: 2026-03-18
Score	7.6	7.7
Rank	#50	#49
Reliability	N/A	N/A
Consistency	9.1	9.9
Tests Correct
Attempt pass rate	70.4%	61.1%
Flaky tests	2	0
Total Runs	54	20
Cost per result	12.047	1.383
Total Cost	$1.446	$0.153
Input Price	$5.000 / 1M	$0.400 / 1M
Output Price	$25.000 / 1M	$2.000 / 1M
Output Tokens	29,829	928
Reasoning Tokens	18,938	72,661
Response Time (avg)	21.08s	16.76s
Response Time (max)	83.40s	158.78s
Response Time (total)	231.84s	301.61s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.11s	112	402

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
MiMo-V2-Omni	4.0	7.9	0.0%	0		68.55s	265	33,660

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
MiMo-V2-Omni	10.0	10.0	100.0%	0		19.29s	131	2,807

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.29s	87	323

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
MiMo-V2-Omni	3.0	10.0	0.0%	0		55.12s	13	33,279

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.86s	58	202

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
MiMo-V2-Omni	8.3	10.0	50.0%	0		4.92s	35	201

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
MiMo-V2-Omni	6.5	10.0	33.3%	0		3.88s	126	481

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
MiMo-V2-Omni	10.0	10.0	100.0%	0		11.07s	101	1,306

Quick Compare

Switch Comparison Pair

Claude Opus 4.6mediumvsQwen3.6 Max Previewnone DeepSeek V4 FlashhighvsMiMo-V2-Omnimedium GPT-5.3 ChatnonevsMiMo-V2-Omnimedium Qwen3.6 Max PreviewnonevsMiMo-V2-Omnimedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsDeepSeek V4 Flashhigh Claude Opus 4.6mediumvsGPT-5.3 Chatnone GPT-5.2 ChatnonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Sonnet 4.6nonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Omnimedium