Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparación benchmark Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) lidera en Puntuación con 9.6. Grok 4.1 Fast (medium) lidera en Fiabilidad con 10.0. Grok 4.1 Fast (medium) tiene el Costo total más bajo con $0.069. Grok 4.20 Multi Agent Beta (medium) es el más rápido con 9.69s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-28

Rango
#147
Total de tokens de salida
93,212
Tiempo de respuesta (promedio)
9.75s
Costo total
$0.750
Rango
#203
Total de tokens de salida
600,042
Tiempo de respuesta (promedio)
9.69s
Costo total
$5.599
Rango
#207
Total de tokens de salida
98,340
Tiempo de respuesta (promedio)
23.85s
Costo total
$0.069
Rango
#3
Total de tokens de salida
232,650
Tiempo de respuesta (promedio)
19.20s
Costo total
$0.742
Modelo recomendado Gemini 3 Flash Preview (medium)

Tiene la mejor puntuación aquí (9.6) y cuesta aproximadamente 2.9x menos que los otros modelos de esta comparación.

Comparación detallada

Métrica Grok 4.20 Beta Grok 4.20 Beta medium Lanzamiento: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Lanzamiento: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Lanzamiento: 2025-12-17
Puntuación 6.0 4.8 4.7 9.6
Rango #147 #203 #207 #3
Fiabilidad N/D N/D 10.0 10.0
Consistencia 7.8 6.4 6.3 9.7
Pruebas correctas
Tasa de aciertos por intento 66.7% 48.5% 53.0% 98.5%
Pruebas inestables 1 5 6 1
Ejecuciones totales 52 52 57 66
Costo por resultado 4.505 62.923 0.642 3.533
Costo total $0.750 $5.599 $0.069 $0.742
Precio de entrada $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Precio de salida $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total de tokens de entrada 35,955 721,952 42,845 87,861
Tokens de salida 1,647 294,668 2,006 5,486
Tokens de razonamiento 91,565 305,374 96,334 227,164
Tiempo de respuesta (promedio) 9.75s 9.69s 23.85s 19.20s
Tiempo de respuesta (máximo) 31.36s 35.28s 121.79s 117.26s
Tiempo de respuesta (total) 175.48s 155.07s 286.16s 422.42s

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 Grok 4.20 Beta

medium
Coste
$0.034
Tiempo
91.0s
Tokens
13,523 tok

#203 Grok 4.20 Multi Agent Beta

medium
Coste
$0.261
Tiempo
123.4s
Tokens
199,344 tok

#207 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Coste
$0.000
Tiempo
0.1s
Tokens
0 tok

#3 Gemini 3 Flash Preview

medium
Coste
$0.010
Tiempo
18.4s
Tokens
3,351 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Comparación rápida

Cambiar par de comparación