AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Z.ai: GLM 5.1

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-29

Métrica	Claude Opus 4.6 Claude Opus 4.6 medium Lanzamiento: 2026-02-05	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07

Métrica	Claude Opus 4.6 Claude Opus 4.6 medium Lanzamiento: 2026-02-05	GLM 5.1 GLM 5.1 medium Lanzamiento: 2026-04-07
Puntuación	7.6	7.8
Rango	#49	#44
Fiabilidad	N/D	N/D
Consistencia	9.1	8.6
Pruebas correctas
Tasa de aciertos por intento	70.4%	75.9%
Pruebas inestables	2	3
Ejecuciones totales	54	54
Costo por resultado	12.047	1.674
Costo total	$1.446	$0.201
Precio de entrada	$5.000 / 1M	$1.050 / 1M
Precio de salida	$25.000 / 1M	$3.500 / 1M
Tokens de salida	29,829	8,005
Tokens de razonamiento	18,938	49,090
Tiempo de respuesta (promedio)	21.08s	24.13s
Tiempo de respuesta (máximo)	83.40s	118.52s
Tiempo de respuesta (total)	231.84s	410.25s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
GLM 5.1	4.7	1.6	66.7%	1		118.52s	1,339	13,777

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
GLM 5.1	8.2	7.2	88.9%	1		23.85s	899	5,627

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

Claude Opus 4.6mediumvsGPT-5.3 Chatnone DeepSeek V4 FlashhighvsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium GPT-5.2 ChatnonevsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium Claude Opus 4.6mediumvsDeepSeek V4 Flashhigh Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Opus 4.6mediumvsGPT-5.2 Chatnone Claude Opus 4.6mediumvsQwen3.6 Max Previewnone Gemini 3.1 Flash Lite PreviewlowvsGLM 5.1medium Gemini 3 Flash PreviewnonevsGLM 5.1medium HY3 PreviewlowDisponible gratisvsGLM 5.1medium