AI BENCHY Compare

MoonshotAI: Kimi K2.6 vs Z.ai: GLM 5.1

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-20

Métrica	Kimi K2.6 Kimi K2.6 medium Lanzamiento: 2026-04-20	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07

Métrica	Kimi K2.6 Kimi K2.6 medium Lanzamiento: 2026-04-20	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07
Puntuación	7.7	7.8
Rango	#34	#33
Consistencia	8.3	8.6
Pruebas correctas
Tasa de aciertos por intento	74.1%	75.9%
Pruebas inestables	4	3
Ejecuciones totales	54	54
Costo por resultado	6.563	1.674
Costo total	$0.722	$0.201
Precio de entrada	$0.950 / 1M	$1.050 / 1M
Precio de salida	$4.000 / 1M	$3.500 / 1M
Tokens de salida	80,759	8,005
Tokens de razonamiento	179,814	49,090
Tiempo de respuesta (promedio)	45.20s	24.13s
Tiempo de respuesta (máximo)	215.85s	118.52s
Tiempo de respuesta (total)	768.37s	410.25s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	7.0	8.0	66.7%	1		11.59s	7,115	8,934
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		106.96s	3,236	18,817
GLM 5.1	4.7	1.6	66.7%	1		118.52s	1,339	13,777

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		40.96s	711	13,876
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		20.38s	316	11,305
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	5.3	7.2	44.4%	1		202.38s	47,035	98,262
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		17.83s	3,981	4,472
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		12.53s	3,977	5,269
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	5.0	5.2	44.5%	2		25.59s	14,140	17,868
GLM 5.1	8.2	7.2	88.9%	1		23.85s	899	5,627

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Kimi K2.6	10.0	10.0	100.0%	0		8.92s	248	1,011
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

Kimi K2.6mediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium GPT-5.2 ChatnonevsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsKimi K2.6medium Kimi K2.6mediumvsGPT-5.2 Chatnone Claude Sonnet 4.6nonevsKimi K2.6medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5.1medium Gemini 3 Flash PreviewnonevsGLM 5.1medium Claude Sonnet 4.6nonevsGLM 5.1medium Gemini 3.1 Flash Lite PreviewlowvsKimi K2.6medium Gemini 3 Flash PreviewnonevsKimi K2.6medium