Comparación benchmark Grok 4.20 (medium) vs Grok 4.20 Beta (medium) vs Grok 4.3 (medium):Grok 4.3 (medium) lidera en Puntuación con 7.0. Grok 4.20 (medium) lidera en Fiabilidad con 10.0. Grok 4.3 (medium) tiene el Costo total más bajo con $0.741. Grok 4.20 Beta (medium) es el más rápido con 9.75s.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-09-10
Modelos comparados
Rango
#145
Total de tokens de salida
270,259
Tiempo de respuesta (promedio)
32.56s
Costo total
$0.805
Rango
#210
Total de tokens de salida
93,212
Tiempo de respuesta (promedio)
9.75s
Costo total
$0.750
Rango
#139
Total de tokens de salida
225,904
Tiempo de respuesta (promedio)
44.21s
Costo total
$0.741
Modelo recomendadoGrok 4.3 (medium)
Tiene la puntuación más alta en esta comparación (7.0) y el mejor equilibrio general entre coste y tiempo de respuesta en los 3 modelos.
7.0Puntaje promedio en todas las pruebas de benchmark.…
6.0Puntaje promedio en todas las pruebas de benchmark.…
7.0Puntaje promedio en todas las pruebas de benchmark.…
Rango
#145
#210
#139
Fiabilidad
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
N/DPuntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
8.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
7.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
8.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3No siguió las instrucciones: 1Tiempo de respuesta (promedio)9.75sTiempo de respuesta (máximo)31.36sTiempo de respuesta (total)175.48sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 6No siguió las instrucciones: 2Formato extra: 1Sin respuesta: 1Tiempo de respuesta (promedio)44.21sTiempo de respuesta (máximo)216.69sTiempo de respuesta (total)972.64sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
60.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
5Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
5Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
66Ejecuciones totales…
52Ejecuciones totales…
66Ejecuciones totales…
Costo por resultado
10.365
4.505
6.168
Costo total
$0.805
$0.750
$0.741
Precio de entrada
$1.250 / 1MPrecio de entrada…
$5.805 / 1MPrecio de entrada…
$1.250 / 1MPrecio de entrada…
Precio de salida
$2.500 / 1MPrecio de salida…
$5.805 / 1MPrecio de salida…
$2.500 / 1MPrecio de salida…
Total de tokens de entrada
102,986Total de tokens de entrada…
35,955Total de tokens de entrada…
140,244Total de tokens de entrada…
Tokens de salida
5,860Tokens de salida…
1,647Tokens de salida…
13,739Tokens de salida…
Tokens de razonamiento
264,399Tokens de razonamiento…
91,565Tokens de razonamiento…
212,165Tokens de razonamiento…
Tiempo de respuesta (promedio)
32.56sTiempo de respuesta (promedio)…
9.75sTiempo de respuesta (promedio)…
44.21sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
199.66sTiempo de respuesta (máximo)…
31.36sTiempo de respuesta (máximo)…
216.69sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
716.36sTiempo de respuesta (total)…
175.48sTiempo de respuesta (total)…
972.64sTiempo de respuesta (total)…
Parámetros
~1T en total (~100B activos)
~1T en total (~100B activos)
~1.5T en total (~150B activos)
Disponibilidad
Código cerrado
Código cerrado
Código cerrado
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
8.2Puntaje promedio en todas las pruebas de benchmark.…
7.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.95sTiempo de respuesta (máximo)5.68sTiempo de respuesta (total)15.80sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.95sTiempo de respuesta (promedio)…
2,010Total de tokens de entrada…
287Tokens de salida…
8,312Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
8.7Puntaje promedio en todas las pruebas de benchmark.…
7.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
91.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.16sTiempo de respuesta (máximo)3.44sTiempo de respuesta (total)12.65sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.83sTiempo de respuesta (máximo)11.20sTiempo de respuesta (total)35.31sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.3Puntaje promedio en todas las pruebas de benchmark.…
6.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
55.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)109.93sTiempo de respuesta (máximo)199.66sTiempo de respuesta (total)329.79sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
109.93sTiempo de respuesta (promedio)…
8,307Total de tokens de entrada…
268Tokens de salida…
103,150Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.3Puntaje promedio en todas las pruebas de benchmark.…
3.3La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)31.36sTiempo de respuesta (máximo)31.36sTiempo de respuesta (total)31.36sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.9Puntaje promedio en todas las pruebas de benchmark.…
7.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)41.23sTiempo de respuesta (máximo)64.81sTiempo de respuesta (total)123.69sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.7Puntaje promedio en todas las pruebas de benchmark.…
6.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)42.25sTiempo de respuesta (máximo)67.09sTiempo de respuesta (total)84.49sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
42.25sTiempo de respuesta (promedio)…
71,267Total de tokens de entrada…
3,776Tokens de salida…
44,009Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.0Puntaje promedio en todas las pruebas de benchmark.…
5.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)20.93sTiempo de respuesta (máximo)20.93sTiempo de respuesta (total)20.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)55.07sTiempo de respuesta (máximo)63.99sTiempo de respuesta (total)110.13sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.17sTiempo de respuesta (máximo)5.02sTiempo de respuesta (total)8.34sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.17sTiempo de respuesta (promedio)…
7,761Total de tokens de entrada…
180Tokens de salida…
5,333Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.01sTiempo de respuesta (máximo)4.27sTiempo de respuesta (total)8.02sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)18.97sTiempo de respuesta (máximo)26.99sTiempo de respuesta (total)37.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.9Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
11.1%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 2Respuesta incorrecta: 1Tiempo de respuesta (promedio)49.71sTiempo de respuesta (máximo)94.92sTiempo de respuesta (total)149.12sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
49.71sTiempo de respuesta (promedio)…
1,959Total de tokens de entrada…
872Tokens de salida…
59,761Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)21.33sTiempo de respuesta (máximo)24.21sTiempo de respuesta (total)64.00sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.5Puntaje promedio en todas las pruebas de benchmark.…
4.4La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)158.01sTiempo de respuesta (máximo)216.69sTiempo de respuesta (total)474.02sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.9Puntaje promedio en todas las pruebas de benchmark.…
2.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)24.48sTiempo de respuesta (máximo)24.48sTiempo de respuesta (total)24.48sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
24.48sTiempo de respuesta (promedio)…
825Total de tokens de entrada…
65Tokens de salida…
6,440Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.78sTiempo de respuesta (máximo)5.78sTiempo de respuesta (total)5.78sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.4Puntaje promedio en todas las pruebas de benchmark.…
2.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)24.70sTiempo de respuesta (máximo)24.70sTiempo de respuesta (total)24.70sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.26sTiempo de respuesta (máximo)4.46sTiempo de respuesta (total)8.52sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.26sTiempo de respuesta (promedio)…
1,362Total de tokens de entrada…
57Tokens de salida…
6,419Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.89sTiempo de respuesta (máximo)5.89sTiempo de respuesta (total)9.78sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)18.58sTiempo de respuesta (máximo)31.48sTiempo de respuesta (total)37.15sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.22sTiempo de respuesta (máximo)11.63sTiempo de respuesta (total)18.66sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.22sTiempo de respuesta (promedio)…
1,689Total de tokens de entrada…
149Tokens de salida…
7,913Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.52sTiempo de respuesta (máximo)4.53sTiempo de respuesta (total)10.57sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.9Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
55.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)22.52sTiempo de respuesta (máximo)51.75sTiempo de respuesta (total)67.57sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)13.68sTiempo de respuesta (máximo)13.68sTiempo de respuesta (total)13.68sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
13.68sTiempo de respuesta (promedio)…
7,275Total de tokens de entrada…
197Tokens de salida…
6,620Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)12.39sTiempo de respuesta (máximo)12.39sTiempo de respuesta (total)12.39sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)17.66sTiempo de respuesta (máximo)17.66sTiempo de respuesta (total)17.66sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)63.48sTiempo de respuesta (máximo)63.48sTiempo de respuesta (total)63.48sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
63.48sTiempo de respuesta (promedio)…
531Total de tokens de entrada…
9Tokens de salida…
16,442Tokens de razonamiento…
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
0.0Puntaje promedio en todas las pruebas de benchmark.…
0.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)44.47sTiempo de respuesta (máximo)44.47sTiempo de respuesta (total)44.47sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…