Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Modelos comparados

Resumen

Comparación benchmark Grok 4.20 Beta vs Grok 4.20 Multi Agent Beta vs Grok 4.1 Fast vs Gemini 3 Flash PreviewGemini 3 Flash Preview lidera en Puntuación con 9.6. Grok 4.1 Fast lidera en Fiabilidad con 10.0. Grok 4.1 Fast tiene el Costo total más bajo con $0.069. Grok 4.20 Multi Agent Beta es el más rápido con 9.69s.

Modelo recomendado: Gemini 3 Flash Preview - Tiene la mejor puntuación aquí (9.6) y cuesta aproximadamente 3.2x menos que los otros modelos de esta comparación.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-12

Métrica Grok 4.20 Beta Grok 4.20 Beta medium Lanzamiento: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lanzamiento: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Lanzamiento: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Lanzamiento: 2025-12-17
Puntuación 9.2 7.3 6.0 9.6
Rango #8 #57 #105 #2
Fiabilidad N/D N/D 10.0 10.0
Consistencia 9.5 7.9 7.3 9.7
Pruebas correctas
Tasa de aciertos por intento 81.5% 59.3% 61.4% 98.4%
Pruebas inestables 1 5 6 1
Ejecuciones totales 52 52 57 63
Costo por resultado 4.505 62.923 0.642 3.335
Costo total $0.750 $5.599 $0.069 $0.667
Precio de entrada $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Precio de salida $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total de tokens de entrada 35,955 721,952 42,845 37,017
Tokens de salida 1,647 294,668 2,006 2,006
Tokens de razonamiento 91,565 305,374 96,334 214,153
Tiempo de respuesta (promedio) 9.75s 9.69s 23.85s 18.64s
Tiempo de respuesta (máximo) 31.36s 35.28s 121.79s 117.26s
Tiempo de respuesta (total) 175.48s 155.07s 286.16s 391.35s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#8 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

#57 Grok 4.20 Multi Agent Beta

medium
Cost
$0.261
Time
123.4s
Tokens
199,344 tok

#105 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Cost
$0.000
Time
0.1s
Tokens
0 tok

#2 Gemini 3 Flash Preview

medium
Cost
$0.010
Time
17.9s
Tokens
3,236 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
Grok 4.20 Multi Agent Beta 6.9 5.8 75.0% 2 3.46s 90,925 33,706 33,077
Grok 4.1 Fast 8.7 7.9 91.7% 1 3.81s 2,358 108 4,741
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.88s 494 330 3,216
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 10.0 10.0 100.0% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 2.3 1.1 33.3% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 10.0 10.0 100.0% 0 37.64s 13,899 261 12,272
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 22.42s 12,873 351 10,485
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 5.54s 97,232 25,306 25,051
Grok 4.1 Fast 10.0 10.0 100.0% 0 6.63s 8,001 180 5,409
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.43s 7,548 279 4,893
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
Grok 4.20 Multi Agent Beta 2.9 7.2 11.1% 1 24.67s 328,253 164,609 163,647
Grok 4.1 Fast 5.8 4.4 66.7% 2 121.79s 1,777 11 37,657
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 15.27s 633 12 21,684
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
Grok 4.20 Multi Agent Beta 5.8 2.8 66.7% 1 6.40s 41,387 15,848 15,746
Grok 4.1 Fast 4.2 9.9 0.0% 0 16.25s 912 127 3,456
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.19s 486 72 1,905
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
Grok 4.20 Multi Agent Beta 9.8 10.0 100.0% 0 3.52s 43,923 19,752 19,617
Grok 4.1 Fast 6.5 10.0 50.0% 0 4.63s 1,536 54 3,326
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.04s 615 72 2,709
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
Grok 4.20 Multi Agent Beta 6.7 7.9 55.6% 1 5.19s 107,020 35,361 35,095
Grok 4.1 Fast 5.3 7.2 44.4% 1 7.40s 1,950 169 5,904
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.05s 558 183 4,365
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 2.8 1.6 33.3% 1 27.71s 10,627 260 11,485
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 12.60s 5,532 234 1,487
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.20 Beta - - - - - - - - -
Grok 4.20 Multi Agent Beta - - - - - - - - -
Grok 4.1 Fast 3.0 10.0 0.0% 0 25.52s 618 15 5,381
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.50s 156 11 2,325

Comparación rápida

Cambiar par de comparación