AI BENCHY Compare

Mistral: Mistral Small 4 vs xAI: Grok 4.20 Beta

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-17

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	Grok 4.20 Beta Grok 4.20 Beta none Lanzamiento: 2026-03-12

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	Grok 4.20 Beta Grok 4.20 Beta none Lanzamiento: 2026-03-12
Rango	#61	#58
Puntuación	5.3	5.3
Consistencia	9.5	9.1
Costo por resultado	0.108	2.240
Costo total	$0.006	$0.090
Pruebas correctas
Tasa de aciertos por intento	33.3%	31.4%
Pruebas inestables	1	2
Ejecuciones totales	51	51
Tokens de salida	1,624	1,517
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	629ms	1.19s
Tiempo de respuesta (máximo)	1.72s	6.48s
Tiempo de respuesta (total)	10.70s	20.22s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.4	7.9	16.7%	1		395ms	182	0
Grok 4.20 Beta	4.0	8.4	16.7%	1		597ms	251	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	496	0
Grok 4.20 Beta	3.0	10.0	0.0%	0		6.48s	282	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		822ms	261	0
Grok 4.20 Beta	10.0	10.0	100.0%	0		601ms	197	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	5.3	10.0	33.3%	0		367ms	28	0
Grok 4.20 Beta	3.0	10.0	0.0%	0		611ms	160	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	4.0	10.0	0.0%	0		729ms	205	0
Grok 4.20 Beta	5.0	10.0	0.0%	0		541ms	87	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	6.5	10.0	50.0%	0		380ms	69	0
Grok 4.20 Beta	4.8	10.0	0.0%	0		687ms	60	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.1	9.9	0.0%	0		589ms	170	0
Grok 4.20 Beta	5.9	7.2	55.6%	1		541ms	291	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	213	0
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.79s	189	0

Comparación rápida

Cambiar par de comparación

Mistral Small 4mediumvsGrok 4.20 Betanone Mistral Small 4nonevsQwen3 Coder Nextmedium Qwen3 Coder NextmediumvsGrok 4.20 Betanone MiniMax M2.5mediumDisponible gratisvsGrok 4.20 Betanone Mistral Small 4nonevsGLM 4.7 Flashmedium MiniMax M2.5mediumDisponible gratisvsMistral Small 4none Grok 4.20 BetanonevsGLM 4.7 Flashmedium gpt-oss-120bmediumDisponible gratisvsGrok 4.20 Betanone Mistral Small 4nonevsgpt-oss-120bmediumDisponible gratis Mistral Small 4nonevsQwen3.5-9Bmedium Qwen3.5-9BmediumvsGrok 4.20 Betanone GPT-5 NanomediumvsGrok 4.20 Betanone