Navegación
Advertise here

Modelos comparados

Comparación benchmark Grok 4.6 (high) vs Seed 2.1 Turbo (low) vs Qwen3.8 2.4T A95B (low) vs Seed-2.0-Code (low): Grok 4.6 (high) lidera en Puntuación con 9.3. Grok 4.6 (high) lidera en Fiabilidad con 10.0. Seed-2.0-Code (low) tiene el Costo total más bajo con $0.767. Seed-2.0-Code (low) es el más rápido con 72.24s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-09-24

Modelos comparados

Rango
#19
Total de tokens de salida
282,217
Tiempo de respuesta (promedio)
84.15s
Costo total
$1.908
Rango
#28
Total de tokens de salida
597,236
Tiempo de respuesta (promedio)
163.90s
Costo total
$1.546
Rango
#78
Total de tokens de salida
495,541
Tiempo de respuesta (promedio)
118.97s
Costo total
$2.672
Rango
#106
Total de tokens de salida
241,309
Tiempo de respuesta (promedio)
72.24s
Costo total
$0.767
Modelo recomendado Grok 4.6 (high)

Tiene la puntuación más alta en esta comparación (9.3) y el mejor equilibrio general entre coste y tiempo de respuesta en los 4 modelos.

Comparación detallada

Métrica Grok 4.6 Grok 4.6 high Lanzamiento: 2026-08-12 Seed 2.1 Turbo Seed 2.1 Turbo low Lanzamiento: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low Lanzamiento: 2026-08-12 Seed-2.0-Code Seed-2.0-Code low Lanzamiento: 2026-08-12
Puntuación 9.3 9.1 8.1 7.7
Rango #19 #28 #78 #106
Fiabilidad 10.0 10.0 9.4 8.5
Consistencia 10.0 9.2 9.2 7.8
Intentos 66/66 66/66 66/66 66/66
Pruebas correctas
Tasa de aciertos por intento 86.4% 80.3% 72.7% 77.3%
Pruebas inestables 0 2 2 6
Ejecuciones totales 66 66 66 66
Costo por resultado 10.042 9.091 17.812 5.899
Costo total $1.908 $1.546 $2.672 $0.767
Precio de entrada $2.000 / 1M $0.500 / 1M $2.000 / 1M $0.500 / 1M
Precio de salida $6.000 / 1M $2.500 / 1M $6.000 / 1M $3.000 / 1M
Total de tokens de entrada 107,275 104,464 113,279 85,657
Tokens de salida 5,094 6,844 121,045 8,142
Tokens de razonamiento 277,123 590,392 374,496 233,167
Tiempo de respuesta (promedio) 84.15s 163.90s 118.97s 72.24s
Tiempo de respuesta (máximo) 618.49s 739.98s 534.21s 485.92s
Tiempo de respuesta (total) 1851.26s 3605.87s 2617.41s 1589.31s
Parámetros ~1.7T en total (~170B activos) ~200B en total (~20B activos) 2.4T en total (95B activos) ~200B en total (~20B activos)
Disponibilidad Código cerrado Código cerrado Pesos disponibles Código cerrado

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#19 SpaceXAI: Grok 4.6

high
Coste
$0.107
Tiempo
265.1s
Tokens
18,001 tok

#28 Seed 2.1 Turbo

low
Coste
$0.049
Tiempo
298.8s
Tokens
19,730 tok

#78 Qwen3.8 2.4T A95B

low
Coste
$0.100
Tiempo
193.2s
Tokens
16,767 tok

#106 Seed-2.0-Code

low
Provider returned error
Coste
$0.000
Tiempo
0.3s
Tokens
0 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829
Seed 2.1 Turbo 10.0 10.0 100.0% 0 360.85s 8,220 385 207,368
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Seed-2.0-Code 7.0 7.1 55.6% 1 109.70s 7,948 455 55,759

Comparación rápida

Cambiar par de comparación