AI BENCHY Compare

OpenAI: GPT-5 Nano vs Grok 4.20 Multi Agent Beta

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-04

Métrica	GPT-5 Nano GPT-5 Nano medium Lanzamiento: 2025-08-07	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12

Métrica	GPT-5 Nano GPT-5 Nano medium Lanzamiento: 2025-08-07	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12
Puntuación	6.2	6.2
Rango	#54	#55
Consistencia	6.7	7.2
Pruebas correctas
Tasa de aciertos por intento	58.8%	54.9%
Pruebas inestables	7	6
Ejecuciones totales	51	51
Costo por resultado	0.864	82.962
Costo total	$0.061	$4.978
Precio de entrada	$0.050 / 1M	$0.000 / 1M
Precio de salida	$0.400 / 1M	$0.000 / 1M
Tokens de salida	4,500	298,948
Tokens de razonamiento	143,296	296,529
Tiempo de respuesta (promedio)	44.47s	8.64s
Tiempo de respuesta (máximo)	204.02s	35.28s
Tiempo de respuesta (total)	444.74s	129.64s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	6.5	7.9	58.3%	1		25.50s	1,221	21,184
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	3.7	1.7	50.0%	2		21.42s	453	10,560
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	5.2	4.4	55.6%	2		204.02s	237	64,448
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	4.1	10.0	0.0%	0		17.51s	202	4,608
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	8.5	6.8	83.3%	1		11.90s	382	4,096
Grok 4.20 Multi Agent Beta	8.3	10.0	50.0%	0		4.63s	25,457	25,322

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	5.3	7.2	44.4%	1		19.81s	869	13,440
Grok 4.20 Multi Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

Comparación rápida

Cambiar par de comparación

Gemma 4 26B A4BnonevsGPT-5 Nanomedium Gemma 4 26B A4BnonevsGrok 4.20 Multi Agent Betamedium DeepSeek V3.2nonevsGPT-5 Nanomedium DeepSeek V3.2nonevsGrok 4.20 Multi Agent Betamedium GPT-5 NanomediumvsMiMo-V2-Omninone Qwen3.5-FlashnonevsGrok 4.20 Multi Agent Betamedium Grok 4.20 Multi Agent BetamediumvsMiMo-V2-Omninone GPT-5 NanomediumvsQwen3.5-Flashnone Grok 4.20 Multi Agent BetamediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGrok 4.20 Multi Agent Betamedium GPT-5 NanomediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGPT-5 Nanomedium