AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Xiaomi: MiMo-V2.5

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-28

Metrică	Claude Opus 4.8 Claude Opus 4.8 none Lansare: 2026-05-28	MiMo-V2.5 MiMo-V2.5 medium Lansare: 2026-04-22

Metrică	Claude Opus 4.8 Claude Opus 4.8 none Lansare: 2026-05-28	MiMo-V2.5 MiMo-V2.5 medium Lansare: 2026-04-22
Scor	7.3	7.4
Rang	#63	#57
Fiabilitate	10.0	10.0
Consistență	9.2	8.4
Teste corecte
Rată de trecere pe încercare	65.0%	70.0%
Teste instabile	2	4
Rulări totale	60	60
Cost per rezultat	4.324	2.876
Cost total	$0.519	$0.052
Preț de intrare	$5.000 / 1M	$0.140 / 1M
Preț de ieșire	$25.000 / 1M	$0.280 / 1M
Tokenuri de ieșire	8,098	2,806
Tokenuri de raționament	0	161,888
Timp de răspuns (mediu)	3.51s	20.35s
Timp de răspuns (maxim)	17.73s	97.49s
Timp de răspuns (total)	70.19s	406.94s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
MiMo-V2.5	10.0	10.0	100.0%	0		4.14s	281	1,739

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
MiMo-V2.5	6.9	6.2	66.7%	1		64.48s	536	44,967

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
MiMo-V2.5	10.0	10.0	100.0%	0		16.86s	363	7,609

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
MiMo-V2.5	2.7	5.7	16.7%	1		6.33s	306	5,714

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
MiMo-V2.5	5.3	10.0	33.3%	0		34.53s	507	49,478

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
MiMo-V2.5	5.4	2.5	66.7%	1		5.37s	121	418

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
MiMo-V2.5	9.9	10.0	100.0%	0		1.80s	88	801

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
MiMo-V2.5	8.2	7.2	88.9%	1		20.25s	279	33,254

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
MiMo-V2.5	10.0	10.0	100.0%	0		7.29s	303	2,424

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
MiMo-V2.5	3.0	10.0	0.0%	0		51.29s	22	15,484

Comparație rapidă

Schimbă perechea de comparație

GPT-5.3 ChatnonevsMiMo-V2.5medium Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash LitelowvsMiMo-V2.5medium Claude Opus 4.8nonevsRing-2.6-1Tmedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5medium Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Opus 4.8nonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsGPT-5 Minimedium Claude Opus 4.8nonevsKimi K2.6mediumDisponibil gratuit