AI BENCHY Compare

Mistral: Mistral Small 4 vs MoonshotAI: Kimi K2.5

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-17

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	Kimi K2.5 Kimi K2.5 none Lanzamiento: 2026-01-27

Métrica	Mistral Small 4 Mistral Small 4 none Lanzamiento: 2026-03-16	Kimi K2.5 Kimi K2.5 none Lanzamiento: 2026-01-27
Rango	#61	#59
Puntuación	5.3	5.3
Consistencia	9.5	8.7
Costo por resultado	0.108	0.297
Costo total	$0.006	$0.015
Pruebas correctas
Tasa de aciertos por intento	33.3%	37.3%
Pruebas inestables	1	3
Ejecuciones totales	51	51
Tokens de salida	1,624	2,010
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	629ms	10.83s
Tiempo de respuesta (máximo)	1.72s	42.13s
Tiempo de respuesta (total)	10.70s	108.27s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.4	7.9	16.7%	1		395ms	182	0
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	373	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	496	0
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	748	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		822ms	261	0
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	187	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	5.3	10.0	33.3%	0		367ms	28	0
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	29	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	4.0	10.0	0.0%	0		729ms	205	0
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	6.5	10.0	50.0%	0		380ms	69	0
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	60	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	3.1	9.9	0.0%	0		589ms	170	0
Kimi K2.5	3.1	10.0	0.0%	0		4.73s	317	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	213	0
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0

Comparación rápida

Cambiar par de comparación

Mistral Small 4mediumvsKimi K2.5none Mistral Small 4nonevsQwen3 Coder Nextmedium Kimi K2.5nonevsQwen3 Coder Nextmedium MiniMax M2.5mediumDisponible gratisvsKimi K2.5none Mistral Small 4nonevsGLM 4.7 Flashmedium MiniMax M2.5mediumDisponible gratisvsMistral Small 4none Kimi K2.5nonevsGLM 4.7 Flashmedium Kimi K2.5nonevsgpt-oss-120bmediumDisponible gratis Mistral Small 4nonevsgpt-oss-120bmediumDisponible gratis Mistral Small 4nonevsQwen3.5-9Bmedium Kimi K2.5nonevsQwen3.5-9Bmedium Kimi K2.5nonevsGrok 4.20 Multi-Agent Betamedium