AI BENCHY Compare

Mistral: Mistral Small 4 vs Z.ai: GLM 4.7 Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-17

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	GLM 4.7 Flash GLM 4.7 Flash none Lanzamiento: 2026-01-19

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	GLM 4.7 Flash GLM 4.7 Flash none Lanzamiento: 2026-01-19
Rango	#61	#57
Puntuación	5.3	5.6
Consistencia	9.5	8.5
Costo por resultado	0.108	0.053
Costo total	$0.006	$0.003
Pruebas correctas
Tasa de aciertos por intento	33.3%	39.2%
Pruebas inestables	1	3
Ejecuciones totales	51	51
Tokens de salida	1,624	1,863
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	629ms	3.13s
Tiempo de respuesta (máximo)	1.72s	7.05s
Tiempo de respuesta (total)	10.70s	31.33s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.4	7.9	16.7%	1		395ms	182	0
GLM 4.7 Flash	5.2	7.9	41.7%	1		5.51s	438	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	496	0
GLM 4.7 Flash	3.0	10.0	0.0%	0		3.22s	704	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		822ms	261	0
GLM 4.7 Flash	7.3	5.8	83.3%	1		4.82s	196	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	5.3	10.0	33.3%	0		367ms	28	0
GLM 4.7 Flash	7.7	10.0	66.7%	0		744ms	19	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	4.0	10.0	0.0%	0		729ms	205	0
GLM 4.7 Flash	4.0	10.0	0.0%	0		1.59s	134	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	6.5	10.0	50.0%	0		380ms	69	0
GLM 4.7 Flash	6.5	10.0	50.0%	0		888ms	62	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.1	9.9	0.0%	0		589ms	170	0
GLM 4.7 Flash	4.4	10.0	0.0%	0		1.00s	98	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	213	0
GLM 4.7 Flash	2.8	1.6	33.3%	1		7.05s	212	0

Comparación rápida

Cambiar par de comparación

Mistral Small 4mediumvsGLM 4.7 Flashnone MiniMax M2.5mediumDisponible gratisvsGLM 4.7 Flashnone gpt-oss-120bmediumDisponible gratisvsGLM 4.7 Flashnone Mistral Small 4nonevsQwen3 Coder Nextmedium Mistral Small 4nonevsGLM 4.7 Flashmedium MiniMax M2.5mediumDisponible gratisvsMistral Small 4none Grok 4.20 Multi-Agent BetamediumvsGLM 4.7 Flashnone GPT-5 NanomediumvsGLM 4.7 Flashnone Mistral Small 4nonevsgpt-oss-120bmediumDisponible gratis Mercury 2mediumvsGLM 4.7 Flashnone Qwen3 Coder NextmediumvsGLM 4.7 Flashnone Mistral Small 4nonevsQwen3.5-9Bmedium