- Rango
- #83
- Total de tokens de salida
- 241,421
- Tiempo de respuesta (promedio)
- 47.45s
- Costo total
- $0.779
Grok 4.3 (medium) vs GLM 5.1 (medium)
La puntuación media está prácticamente empatada en 7.1 vs 7.1. GLM 5.1 (medium) tiene menor coste de benchmark con $0.535 vs $0.779. GLM 5.1 (medium) es más rápido con 46.77s vs 47.45s, con tasas de acierto de 68.2% vs 69.7%.
- Rango
- #84
- Total de tokens de salida
- 152,552
- Tiempo de respuesta (promedio)
- 46.77s
- Costo total
- $0.535
Modelo recomendado
GLM 5.1 (medium)
Tiene la puntuación más alta en esta comparación (7.1) y el mejor equilibrio general entre coste y tiempo de respuesta en los 2 modelos.
Comparación detallada
| Métrica | Grok 4.3 Grok 4.3 medium | GLM 5.1 GLM 5.1 medium |
|---|---|---|
| Puntuación | 7.1 | 7.1 |
| Rango | #83 | #84 |
| Fiabilidad | 10.0 | 8.3 |
| Consistencia | 8.6 | 8.4 |
| Pruebas correctas | ||
| Tasa de aciertos por intento | 68.2% | 69.7% |
| Pruebas inestables | 4 | 4 |
| Ejecuciones totales | 66 | 66 |
| Costo por resultado | 5.990 | 4.202 |
| Costo total | $0.779 | $0.535 |
| Precio de entrada | $1.250 / 1M | $0.966 / 1M |
| Precio de salida | $2.500 / 1M | $3.036 / 1M |
| Total de tokens de entrada | 140,031 | 82,623 |
| Tokens de salida | 13,739 | 16,089 |
| Tokens de razonamiento | 227,682 | 136,463 |
| Tiempo de respuesta (promedio) | 47.45s | 46.77s |
| Tiempo de respuesta (máximo) | 216.69s | 308.75s |
| Tiempo de respuesta (total) | 1043.83s | 982.16s |
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#83 xAI: Grok 4.3
medium- Coste
- $0.009
- Tiempo
- 19.0s
- Tokens
- 3,661 tok
#84 GLM 5.1
medium
SVG inválido
- Coste
- $0.000
- Tiempo
- 300.0s
- Tokens
- 0 tok
Mejores modelos por puntuación
Puntuación vs costo total
Tiempo de respuesta (promedio)
Puntuación vs Tiempo de respuesta (promedio)
Total de tokens de salida
Puntuación vs Total de tokens de salida
Desglose por categoría
| Análisis y extracción de datos | Puntuación | Consistencia | Tasa de aciertos por intento | Pruebas inestables | Pruebas correctas | Tiempo de respuesta (promedio) | Tokens de entrada | Tokens de salida | Tokens de razonamiento |
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.3 | 10.0 | 10.0 | 100.0% | 0 | 18.97s | 7,761 | 180 | 9,546 | |
| GLM 5.1 | 10.0 | 10.0 | 100.0% | 0 | 9.33s | 7,107 | 991 | 4,552 |
| Seguimiento de instrucciones | Puntuación | Consistencia | Tasa de aciertos por intento | Pruebas inestables | Pruebas correctas | Tiempo de respuesta (promedio) | Tokens de entrada | Tokens de salida | Tokens de razonamiento |
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.3 | 9.8 | 10.0 | 100.0% | 0 | 18.58s | 1,362 | 57 | 8,713 | |
| GLM 5.1 | 6.4 | 5.8 | 66.7% | 1 | 7.47s | 634 | 204 | 1,617 |
Comparación rápida
Cambiar par de comparación
Qwen3.7 PlusnonevsGrok 4.3mediumQwen3.7 PlusnonevsGLM 5.1mediumKAT-Coder-Pro V2.5highvsGrok 4.3mediumKAT-Coder-Pro V2.5highvsGLM 5.1mediumStep 3.7 FlashlowvsGrok 4.3mediumStep 3.7 FlashlowvsGLM 5.1mediumClaude Opus 4.8nonevsGrok 4.3mediumGemini 3.5 FlashnonevsGLM 5.1mediumQwen3.7 FlashlowvsGrok 4.3mediumClaude Opus 4.8nonevsGLM 5.1mediumGemini 3.5 FlashnonevsGrok 4.3mediumQwen3.7 FlashlowvsGLM 5.1medium