AI BENCHY Compare

Grok 4.20 Multi Agent Beta vs GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-02

Métrica	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12	GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT none Lanzamiento: Fecha de lanzamiento desconocida

Métrica	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12	GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT none Lanzamiento: Fecha de lanzamiento desconocida
Puntuación	6.2	3.0
Rango	#53	#88
Consistencia	7.2	10.0
Pruebas correctas
Tasa de aciertos por intento	54.9%	0.0%
Pruebas inestables	6	0
Ejecuciones totales	51	48
Costo por resultado	82.962	0.000
Costo total	$4.978	$0.000
Precio de entrada	$0.000 / 1M	$0.000 / 1M
Precio de salida	$0.000 / 1M	$0.000 / 1M
Tokens de salida	298,948	0
Tokens de razonamiento	296,529	0
Tiempo de respuesta (promedio)	8.64s	0ms
Tiempo de respuesta (máximo)	35.28s	0ms
Tiempo de respuesta (total)	129.64s	0ms

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0
GLM 5v Turbo X Ai/grok 4.20 Google/gemma 4 31b IT	3.0	10.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

DeepSeek V3.2nonevsGrok 4.20 Multi Agent Betamedium Qwen3.5-FlashnonevsGrok 4.20 Multi Agent Betamedium Grok 4.20 Multi Agent BetamediumvsMiMo-V2-Omninone Grok 4.20 Multi Agent BetamediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGrok 4.20 Multi Agent Betamedium Gemini 2.5 FlashnonevsGrok 4.20 Multi Agent Betamedium Qwen3.5-35B-A3BnonevsGrok 4.20 Multi Agent Betamedium Hunter AlphanonevsGrok 4.20 Multi Agent Betamedium Qwen3.5-122B-A10BnonevsGrok 4.20 Multi Agent Betamedium Grok 4.20 Multi Agent BetamediumvsMiMo-V2-Pronone Grok 4.20 Multi Agent BetamediumvsGLM 5none Gemma 4 31BnonevsGrok 4.20 Multi Agent Betamedium