AI BENCHY Compare

OpenAI: gpt-oss-120b vs Xiaomi: MiMo-V2.5-Pro

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-22

Metrică	gpt-oss-120b gpt-oss-120b none Lansare: 2025-08-05 Disponibil gratuit	MiMo-V2.5-Pro MiMo-V2.5-Pro none Lansare: 2026-04-22

Metrică	gpt-oss-120b gpt-oss-120b none Lansare: 2025-08-05 Disponibil gratuit	MiMo-V2.5-Pro MiMo-V2.5-Pro none Lansare: 2026-04-22
Scor	5.2	5.6
Rang	#129	#115
Fiabilitate	10.0	10.0
Consistență	8.7	8.5
Teste corecte
Rată de trecere pe încercare	36.8%	41.7%
Teste instabile	3	4
Rulări totale	57	60
Cost per rezultat	0.201	0.637
Cost total	$0.011	$0.039
Preț de intrare	$0.000 / 1M	$1.000 / 1M
Preț de ieșire	$0.000 / 1M	$3.000 / 1M
Tokenuri de ieșire	51,505	3,067
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	21.86s	1.84s
Timp de răspuns (maxim)	113.71s	8.32s
Timp de răspuns (total)	349.78s	36.84s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	8,676	0
MiMo-V2.5-Pro	3.3	8.1	8.3%	1		2.67s	994	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0
MiMo-V2.5-Pro	5.0	6.7	33.3%	1		1.80s	479	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
MiMo-V2.5-Pro	3.0	10.0	0.0%	0		3.54s	596	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		1.32s	249	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0
MiMo-V2.5-Pro	5.3	10.0	33.3%	0		877ms	27	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	615	0
MiMo-V2.5-Pro	4.0	10.0	0.0%	0		2.58s	87	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	9.8	10.0	100.0%	0		5.10s	1,982	0
MiMo-V2.5-Pro	6.4	10.0	50.0%	0		1.03s	66	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	4.4	4.5	44.5%	2		9.51s	3,781	0
MiMo-V2.5-Pro	6.7	4.7	77.8%	2		1.32s	297	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		3.30s	258	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	3,138	0
MiMo-V2.5-Pro	3.0	10.0	0.0%	0		1.89s	14	0

Comparație rapidă

Schimbă perechea de comparație

gpt-oss-120bmediumDisponibil gratuitvsMiMo-V2.5-Pronone MiniMax M2.5mediumDisponibil gratuitvsMiMo-V2.5-Pronone MiniMax M2.7mediumvsgpt-oss-120bnoneDisponibil gratuit Mistral Small 4mediumvsMiMo-V2.5-Pronone CobuddymediumDisponibil gratuitvsMiMo-V2.5-Pronone Elephant AlphamediumvsMiMo-V2.5-Pronone gpt-oss-120bnoneDisponibil gratuitvsElephant Alphamedium Mistral Small 4mediumvsgpt-oss-120bnoneDisponibil gratuit MiniMax M2.5mediumDisponibil gratuitvsgpt-oss-120bnoneDisponibil gratuit Owl AlphamediumvsMiMo-V2.5-Pronone Nemotron 3 SupermediumDisponibil gratuitvsMiMo-V2.5-Pronone gpt-oss-120bnoneDisponibil gratuitvsQwen3 Coder Nextmedium