AI BENCHY Compare

Qwen: Qwen3.5-27B vs Xiaomi: MiMo-V2.5

Rezumat

Comparație benchmark Qwen3.5-27B vs MiMo-V2.5: Qwen3.5-27B conduce la scorul mediu cu 5.7 vs 4.9. MiMo-V2.5 are costul de benchmark mai mic, $0.007 vs $0.015. Qwen3.5-27B este mai rapid cu 1.68s vs 2.20s, cu rate de reușită de 38.1% vs 27.0%.

Model recomandat: MiMo-V2.5 - Oferă cel mai bun compromis per total: scor competitiv (4.9), cost mai mic decât Qwen3.5-27B și timp de răspuns echilibrat.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-04

Metrică	Qwen3.5-27B Qwen3.5-27B none Lansare: 2026-02-24	MiMo-V2.5 MiMo-V2.5 none Lansare: 2026-04-22

Metrică	Qwen3.5-27B Qwen3.5-27B none Lansare: 2026-02-24	MiMo-V2.5 MiMo-V2.5 none Lansare: 2026-04-22
Scor	5.7	4.9
Rang	#115	#143
Fiabilitate	10.0	10.0
Consistență	9.3	9.6
Teste corecte
Rată de trecere pe încercare	38.1%	27.0%
Teste instabile	2	1
Rulări totale	63	63
Cost per rezultat	0.249	0.413
Cost total	$0.015	$0.007
Preț de intrare	$0.195 / 1M	$0.140 / 1M
Preț de ieșire	$1.560 / 1M	$0.280 / 1M
Total tokenuri de intrare	44,478	41,985
Tokenuri de ieșire	3,592	2,267
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	1.68s	2.20s
Timp de răspuns (maxim)	9.39s	6.86s
Timp de răspuns (total)	35.25s	46.21s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#115 Qwen3.5-27B

none

Cost: $0.007
Time: 42.9s
Tokens: 4,273 tok

#143 MiMo-V2.5

none

Cost: $0.007
Time: 267.4s
Tokens: 25,283 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	4.8	10.0	25.0%	0		788ms	696	267	0
MiMo-V2.5	3.5	8.0	16.7%	1		2.19s	645	282	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	5.8	10.0	33.3%	0		1.80s	7,913	415	0
MiMo-V2.5	5.5	10.0	33.3%	0		3.24s	7,440	696	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	2.8	1.6	33.3%	1		9.39s	16,918	1,461	0
MiMo-V2.5	3.0	10.0	0.0%	0		2.36s	15,075	330	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	10.0	10.0	100.0%	0		1.43s	7,794	243	0
MiMo-V2.5	6.5	10.0	50.0%	0		1.01s	7,758	366	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	3.0	10.0	0.0%	0		540ms	789	15	0
MiMo-V2.5	3.0	10.0	0.0%	0		756ms	753	27	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	5.0	10.0	0.0%	0		2.51s	522	126	0
MiMo-V2.5	4.4	9.9	0.0%	0		6.86s	498	81	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	6.3	10.0	50.0%	0		1.03s	711	69	0
MiMo-V2.5	6.5	10.0	50.0%	0		751ms	684	72	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	6.7	7.9	55.6%	1		1.38s	714	683	0
MiMo-V2.5	5.4	10.0	33.3%	0		2.13s	678	166	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	10.0	10.0	100.0%	0		3.54s	8,211	303	0
MiMo-V2.5	10.0	10.0	100.0%	0		2.43s	8,238	231	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.5-27B	3.0	10.0	0.0%	0		599ms	210	10	0
MiMo-V2.5	3.0	10.0	0.0%	0		3.89s	216	16	0

Comparație rapidă

Schimbă perechea de comparație

CobuddymediumvsQwen3.5-27Bnone Nemotron 3 SupermediumDisponibil gratuitvsQwen3.5-27Bnone Qwen3 Coder NextmediumvsMiMo-V2.5none DeepSeek V4 ProhighvsQwen3.5-27Bnone MiniMax M2.5mediumvsQwen3.5-27Bnone MiniMax M2.7mediumvsQwen3.5-27Bnone Mistral Small 4mediumvsQwen3.5-27Bnone Mistral Small 4mediumvsMiMo-V2.5none MiniMax M2.7mediumvsMiMo-V2.5none gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-27Bnone MiniMax M2.5mediumvsMiMo-V2.5none MiMo-V2.5nonevsGLM 4.7 Flashmedium