Qwen: Qwen3.5-9B vs Xiaomi: MiMo-V2.5

La puntuación media está prácticamente empatada en 5.1 vs 5.1. Qwen3.5-9B tiene menor coste de benchmark con $0.021 vs $0.025. MiMo-V2.5 es más rápido con 4.62s vs 19.17s, con tasas de acierto de 19.7% vs 25.8%.

Modelo recomendadoMiMo-V2.5Tiene la mejor puntuación aquí (5.1) y responde aproximadamente 4.2x más rápido que Qwen3.5-9B.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-22

Métrica	Qwen3.5-9B Qwen3.5-9B none Lanzamiento: 2026-03-02	MiMo-V2.5 MiMo-V2.5 none Lanzamiento: 2026-04-22

Métrica	Qwen3.5-9B Qwen3.5-9B none Lanzamiento: 2026-03-02	MiMo-V2.5 MiMo-V2.5 none Lanzamiento: 2026-04-22
Puntuación	5.1	5.1
Rango	#177	#176
Fiabilidad	10.0	10.0
Consistencia	9.7	9.6
Pruebas correctas
Tasa de aciertos por intento	19.7%	25.8%
Pruebas inestables	1	1
Ejecuciones totales	66	66
Costo por resultado	0.490	0.770
Costo total	$0.021	$0.025
Precio de entrada	$0.100 / 1M	$0.140 / 1M
Precio de salida	$0.150 / 1M	$0.280 / 1M
Total de tokens de entrada	144,407	141,043
Tokens de salida	37,484	16,464
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	19.17s	4.62s
Tiempo de respuesta (máximo)	382.06s	55.36s
Tiempo de respuesta (total)	421.74s	101.57s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#177 Qwen3.5-9B

none

SVG inválido

Coste: $0.000
Tiempo: 300.0s
Tokens: 0 tok

#176 MiMo-V2.5

none

Coste: $0.007
Tiempo: 267.4s
Tokens: 25,283 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Categoría:

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.1	9.9	0.0%	0		1.71s	696	582	0
MiMo-V2.5	3.5	8.0	16.7%	1		2.19s	645	282	0

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.9	7.8	11.1%	1		5.60s	7,913	1,042	0
MiMo-V2.5	5.5	10.0	33.3%	0		3.24s	7,440	696	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.0	10.0	0.0%	0		193.98s	116,763	34,787	0
MiMo-V2.5	3.0	10.0	0.0%	0		28.86s	114,133	14,527	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	10.0	10.0	100.0%	0		847ms	7,788	249	0
MiMo-V2.5	6.5	10.0	50.0%	0		1.01s	7,758	366	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.0	10.0	0.0%	0		464ms	789	24	0
MiMo-V2.5	3.0	10.0	0.0%	0		756ms	753	27	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	4.4	9.9	0.0%	0		552ms	522	99	0
MiMo-V2.5	4.4	9.9	0.0%	0		6.86s	498	81	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	6.5	10.0	50.0%	0		514ms	711	75	0
MiMo-V2.5	6.5	10.0	50.0%	0		751ms	684	72	0

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.2	10.0	0.0%	0		621ms	714	347	0
MiMo-V2.5	5.4	10.0	33.3%	0		2.13s	678	166	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	8,301	273	0
MiMo-V2.5	10.0	10.0	100.0%	0		2.43s	8,238	231	0

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.5-9B	3.0	10.0	0.0%	0		2.32s	210	6	0
MiMo-V2.5	3.0	10.0	0.0%	0		3.89s	216	16	0

Comparación rápida

Cambiar par de comparación

Mistral Small 4mediumvsMiMo-V2.5none Mistral Small 4mediumvsQwen3.5-9Bnone MiniMax M2.7mediumvsQwen3.5-9Bnone MiniMax M2.7mediumvsMiMo-V2.5none Laguna S 2.1lowDisponible gratisvsQwen3.5-9Bnone Laguna S 2.1lowDisponible gratisvsMiMo-V2.5none Laguna S 2.1highDisponible gratisvsMiMo-V2.5none Laguna S 2.1highDisponible gratisvsQwen3.5-9Bnone KAT-Coder-Air V2.5lowvsMiMo-V2.5none KAT-Coder-Air V2.5lowvsQwen3.5-9Bnone Laguna S 2.1mediumDisponible gratisvsMiMo-V2.5none Laguna S 2.1mediumDisponible gratisvsQwen3.5-9Bnone