AI BENCHY Compare

OpenAI: GPT-4o-mini vs Z.ai: GLM 4.7 Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-29

Métrica	GPT-4o-mini GPT-4o-mini none Lanzamiento: 2024-07-18	GLM 4.7 Flash GLM 4.7 Flash medium Lanzamiento: 2026-01-19

Métrica	GPT-4o-mini GPT-4o-mini none Lanzamiento: 2024-07-18	GLM 4.7 Flash GLM 4.7 Flash medium Lanzamiento: 2026-01-19
Puntuación	4.9	4.5
Rango	#144	#154
Fiabilidad	10.0	10.0
Consistencia	9.9	6.7
Pruebas correctas
Tasa de aciertos por intento	25.0%	35.0%
Pruebas inestables	0	8
Ejecuciones totales	60	60
Costo por resultado	0.111	1.337
Costo total	$0.006	$0.054
Precio de entrada	$0.150 / 1M	$0.060 / 1M
Precio de salida	$0.600 / 1M	$0.400 / 1M
Tokens de salida	1,977	43,754
Tokens de razonamiento	0	89,079
Tiempo de respuesta (promedio)	1.85s	35.10s
Tiempo de respuesta (máximo)	7.58s	174.55s
Tiempo de respuesta (total)	24.00s	456.24s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	4.8	10.0	25.0%	0		1.34s	186	0
GLM 4.7 Flash	4.7	5.9	41.7%	2		14.95s	1,122	6,110

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.2	9.3	0.0%	0		2.05s	362	0
GLM 4.7 Flash	3.4	6.0	16.7%	1		55.33s	4,981	22,387

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		7.58s	568	0
GLM 4.7 Flash	2.8	2.1	33.3%	1		65.57s	2,585	20,648

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	10.0	10.0	100.0%	0		1.27s	183	0
GLM 4.7 Flash	6.3	10.0	50.0%	0		1.51s	584	2,755

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		637ms	15	0
GLM 4.7 Flash	3.5	4.4	33.3%	2		174.55s	33,000	25,394

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	4.0	10.0	0.0%	0		909ms	66	0
GLM 4.7 Flash	3.6	9.7	0.0%	0		18.14s	18	2,138

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	6.3	10.0	50.0%	0		1.11s	69	0
GLM 4.7 Flash	6.2	5.8	66.7%	1		2.97s	388	2,181

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.5	10.0	0.0%	0		1.21s	308	0
GLM 4.7 Flash	2.9	7.2	11.1%	1		12.93s	781	5,255

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0
GLM 4.7 Flash	10.0	10.0	100.0%	0		15.95s	224	1,014

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-4o-mini	3.0	10.0	0.0%	0		794ms	15	0
GLM 4.7 Flash	3.0	10.0	0.0%	0		11.13s	71	1,197

Comparación rápida

Cambiar par de comparación

Ling-2.6-1TnonevsGLM 4.7 Flashmedium GPT-4o-mininonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium MiMo-V2-FlashnonevsGLM 4.7 Flashmedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium GPT-5.4 NanononevsGLM 4.7 Flashmedium Trinity Large PreviewnonevsGLM 4.7 Flashmedium Granite 4.1 8BnonevsGLM 4.7 Flashmedium Qwen3.6 35B A3BnonevsGLM 4.7 Flashmedium GPT-5.4 MininonevsGLM 4.7 Flashmedium MiMo-V2.5nonevsGLM 4.7 Flashmedium Mistral Small 4nonevsGLM 4.7 Flashmedium