Navegación
AI BENCHY
Your ad here

AI BENCHY Compare

OpenAI: GPT-4o-mini vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-12

Métrica GPT-4o-mini GPT-4o-mini none Lanzamiento: 2024-07-18 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lanzamiento: 2026-03-12
Rango #55 #47
Puntaje prom. 4.0 4.9
Consistencia 10.0 7.1
Costo por resultado 0.114 97.178
Costo total $0.005 $4.859
Pruebas correctas
Tasa de aciertos por intento 25.0% 52.1%
Pruebas inestables 0 6
Ejecuciones totales 48 48
Tokens de salida 1,594 293,634
Tokens de razonamiento 0 291,260
Tiempo de respuesta (promedio) 2.07s 9.08s
Tiempo de respuesta (máximo) 7.58s 35.28s
Tiempo de respuesta (total) 18.60s 127.09s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntaje prom. vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntaje prom. vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 4.0 10.0 33.3% 0 1.83s 180 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 10.0 10.0 0.0% 0 7.58s 568 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 9.9 10.0 100.0% 0 1.27s 183 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 10.0 10.0 0.0% 0 637ms 15 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 3.0 10.0 0.0% 0 909ms 66 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 4.5 10.0 0.0% 0 1.27s 69 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 2.3 10.0 0.0% 0 1.30s 308 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-4o-mini 10.0 10.0 100.0% 0 2.51s 205 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparación rápida

Cambiar par de comparación