AI BENCHY Compare

Xiaomi: MiMo-V2.5 vs Z.ai: GLM 5.1

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-22

Métrica	MiMo-V2.5 MiMo-V2.5 medium Lanzamiento: 2026-04-22	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07

Métrica	MiMo-V2.5 MiMo-V2.5 medium Lanzamiento: 2026-04-22	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07
Puntuación	7.8	7.8
Rango	#35	#34
Consistencia	8.6	8.6
Pruebas correctas
Tasa de aciertos por intento	74.1%	75.9%
Pruebas inestables	3	3
Ejecuciones totales	54	54
Costo por resultado	2.102	1.674
Costo total	$0.253	$0.201
Precio de entrada	$0.400 / 1M	$1.050 / 1M
Precio de salida	$2.000 / 1M	$3.500 / 1M
Tokens de salida	2,840	8,005
Tokens de razonamiento	116,242	49,090
Tiempo de respuesta (promedio)	13.71s	24.13s
Tiempo de respuesta (máximo)	86.93s	118.52s
Tiempo de respuesta (total)	246.73s	410.25s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	10.0	10.0	100.0%	0		1.98s	303	2,022
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	10.0	10.0	100.0%	0		31.48s	488	14,813
GLM 5.1	4.7	1.6	66.7%	1		118.52s	1,339	13,777

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	10.0	10.0	100.0%	0		16.86s	363	7,609
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	2.7	5.7	16.7%	1		6.33s	306	5,714
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	5.3	10.0	33.3%	0		34.53s	507	49,478
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	3.8	2.5	33.3%	1		1.55s	118	170
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	9.9	10.0	100.0%	0		1.80s	88	801
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	8.2	7.2	88.9%	1		20.60s	364	33,211
GLM 5.1	8.2	7.2	88.9%	1		23.85s	899	5,627

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
MiMo-V2.5	10.0	10.0	100.0%	0		7.29s	303	2,424
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

GPT-5.3 ChatnonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium GPT-5.2 ChatnonevsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5medium GPT-5.2 ChatnonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5.1medium Gemini 3 Flash PreviewnonevsGLM 5.1medium Claude Sonnet 4.6nonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2.5medium Gemini 3 Flash PreviewnonevsMiMo-V2.5medium Claude Sonnet 4.6nonevsGLM 5.1medium