AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Xiaomi: MiMo-V2-Omni

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-01

Metrică	Claude Opus 4.6 Claude Opus 4.6 medium Lansare: 2026-02-05	MiMo-V2-Omni MiMo-V2-Omni medium Lansare: 2026-03-18

Metrică	Claude Opus 4.6 Claude Opus 4.6 medium Lansare: 2026-02-05	MiMo-V2-Omni MiMo-V2-Omni medium Lansare: 2026-03-18
Scor	7.6	7.7
Rang	#50	#49
Fiabilitate	N/D	N/D
Consistență	9.1	9.9
Teste corecte
Rată de trecere pe încercare	70.4%	61.1%
Teste instabile	2	0
Rulări totale	54	20
Cost per rezultat	12.047	1.383
Cost total	$1.446	$0.153
Preț de intrare	$5.000 / 1M	$0.400 / 1M
Preț de ieșire	$25.000 / 1M	$2.000 / 1M
Tokenuri de ieșire	29,829	928
Tokenuri de raționament	18,938	72,661
Timp de răspuns (mediu)	21.08s	16.76s
Timp de răspuns (maxim)	83.40s	158.78s
Timp de răspuns (total)	231.84s	301.61s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.11s	112	402

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
MiMo-V2-Omni	4.0	7.9	0.0%	0		68.55s	265	33,660

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
MiMo-V2-Omni	10.0	10.0	100.0%	0		19.29s	131	2,807

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.29s	87	323

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
MiMo-V2-Omni	3.0	10.0	0.0%	0		55.12s	13	33,279

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
MiMo-V2-Omni	10.0	10.0	100.0%	0		2.86s	58	202

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
MiMo-V2-Omni	8.3	10.0	50.0%	0		4.92s	35	201

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
MiMo-V2-Omni	6.5	10.0	33.3%	0		3.88s	126	481

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
MiMo-V2-Omni	10.0	10.0	100.0%	0		11.07s	101	1,306

Comparație rapidă

Schimbă perechea de comparație

Claude Opus 4.6mediumvsQwen3.6 Max Previewnone DeepSeek V4 FlashhighvsMiMo-V2-Omnimedium GPT-5.3 ChatnonevsMiMo-V2-Omnimedium Qwen3.6 Max PreviewnonevsMiMo-V2-Omnimedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsDeepSeek V4 Flashhigh Claude Opus 4.6mediumvsGPT-5.3 Chatnone GPT-5.2 ChatnonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Sonnet 4.6nonevsMiMo-V2-Omnimedium Claude Opus 4.6mediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Omnimedium