Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparación benchmark Grok 4.6 (high) vs Seed 2.1 Turbo (low) vs Qwen3.8 2.4T A95B (low) vs Seed-2.0-Code (low): Grok 4.6 (high) lidera en Puntuación con 9.2. Grok 4.6 (high) lidera en Fiabilidad con 10.0. Seed-2.0-Code (low) tiene el Costo total más bajo con $0.681. Seed-2.0-Code (low) es el más rápido con 65.89s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-08-12

Rango
#11
Total de tokens de salida
265,604
Tiempo de respuesta (promedio)
79.38s
Costo total
$1.809
Rango
#15
Total de tokens de salida
631,257
Tiempo de respuesta (promedio)
168.41s
Costo total
$1.631
Rango
#46
Total de tokens de salida
554,485
Tiempo de respuesta (promedio)
132.39s
Costo total
$3.113
Rango
#66
Total de tokens de salida
212,558
Tiempo de respuesta (promedio)
65.89s
Costo total
$0.681
Modelo recomendado Grok 4.6 (high)

Tiene la mejor puntuación aquí (9.2) y responde aproximadamente 1.5x más rápido que los otros modelos de esta comparación.

Comparación detallada

Métrica Grok 4.6 Grok 4.6 high Lanzamiento: 2026-08-12 Seed 2.1 Turbo Seed 2.1 Turbo low Lanzamiento: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low Lanzamiento: 2026-08-12 Seed-2.0-Code Seed-2.0-Code low Lanzamiento: 2026-08-12
Puntuación 9.2 9.1 8.2 7.7
Rango #11 #15 #46 #66
Fiabilidad 10.0 9.9 9.1 5.7
Consistencia 9.6 8.9 8.9 7.5
Intentos 66/66 66/66 66/66 66/66
Pruebas correctas
Tasa de aciertos por intento 84.9% 83.3% 78.8% 80.3%
Pruebas inestables 1 3 3 7
Ejecuciones totales 66 66 66 66
Costo por resultado 10.046 9.591 19.453 5.235
Costo total $1.809 $1.631 $3.113 $0.681
Precio de entrada $2.000 / 1M $0.500 / 1M $2.000 / 1M $0.500 / 1M
Precio de salida $6.000 / 1M $2.500 / 1M $6.000 / 1M $3.000 / 1M
Total de tokens de entrada 107,266 104,483 113,340 85,648
Tokens de salida 5,094 6,848 107,311 8,142
Tokens de razonamiento 260,510 624,409 447,174 204,416
Tiempo de respuesta (promedio) 79.38s 168.41s 132.39s 65.89s
Tiempo de respuesta (máximo) 618.49s 739.98s 534.21s 485.92s
Tiempo de respuesta (total) 1746.29s 3705.09s 2912.56s 1449.53s
Parámetros ~1.7T en total (~170B activos) ~200B en total (~20B activos) 2.4T en total (95B activos) ~200B en total (~20B activos)
Disponibilidad Código cerrado Código cerrado Pesos disponibles Código cerrado

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 SpaceXAI: Grok 4.6

high
Coste
$0.107
Tiempo
265.1s
Tokens
18,001 tok

#15 Seed 2.1 Turbo

low
Coste
$0.049
Tiempo
298.8s
Tokens
19,730 tok

#46 Qwen3.8 2.4T A95B

low
Coste
$0.100
Tiempo
193.2s
Tokens
16,767 tok

#66 Seed-2.0-Code

low
Provider returned error
Coste
$0.000
Tiempo
0.3s
Tokens
0 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829
Seed 2.1 Turbo 10.0 10.0 100.0% 0 360.85s 8,220 385 207,368
Qwen3.8 2.4T A95B 7.6 7.2 77.8% 1 172.53s 6,716 21,405 57,399
Seed-2.0-Code 7.0 5.0 77.8% 2 109.70s 7,948 455 55,759

Comparación rápida

Cambiar par de comparación