Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-26
Métrica
Grok 4.20 BetaGrok 4.20 BetamediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-03-12
Grok 4.1 FastGrok 4.1 FastmediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2025-11-19
Hunter AlphaHunter AlphamediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-03-11
Métrica
Grok 4.20 BetaGrok 4.20 BetamediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-03-12
Grok 4.1 FastGrok 4.1 FastmediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2025-11-19
Hunter AlphaHunter AlphamediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-03-11
Puntuación
8.5Puntaje promedio en todas las pruebas de benchmark.…
6.5Puntaje promedio en todas las pruebas de benchmark.…
6.7Puntaje promedio en todas las pruebas de benchmark.…
Rango
#14
#88
#76
Fiabilidad
N/DPuntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
N/DPuntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
9.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
7.3La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
7.4La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3No siguió las instrucciones: 1Tiempo de respuesta (promedio)9.75sTiempo de respuesta (máximo)31.36sTiempo de respuesta (total)175.48sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 4Respuesta incorrecta: 4Sin respuesta: 1Tiempo agotado: 1Tiempo de respuesta (promedio)23.85sTiempo de respuesta (máximo)121.79sTiempo de respuesta (total)286.16sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
81.5%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
61.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
64.8%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
6Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
6Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
128Ejecuciones totales…
133Ejecuciones totales…
90Ejecuciones totales…
Costo por resultado
8.557Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
0.926Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
0.000Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
Costo total
$1.198Costo total…
$0.084Costo total…
$0.000Costo total…
Precio de entrada
$0.000 / 1MPrecio de entrada…
$0.000 / 1MPrecio de entrada…
$0.000 / 1MPrecio de entrada…
Precio de salida
$0.000 / 1MPrecio de salida…
$0.000 / 1MPrecio de salida…
$0.000 / 1MPrecio de salida…
Tokens de salida
4,915Tokens de salida…
3,298Tokens de salida…
6,506Tokens de salida…
Tokens de razonamiento
177,787Tokens de razonamiento…
139,122Tokens de razonamiento…
24,809Tokens de razonamiento…
Tiempo de respuesta (promedio)
9.75sTiempo de respuesta (promedio)…
23.85sTiempo de respuesta (promedio)…
10.33sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
31.36sTiempo de respuesta (máximo)…
121.79sTiempo de respuesta (máximo)…
30.53sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
175.48sTiempo de respuesta (total)…
286.16sTiempo de respuesta (total)…
175.58sTiempo de respuesta (total)…
Mejores modelos por puntuación
Puntuación vs costo total
Tiempo de respuesta (promedio)
Puntuación vs Tiempo de respuesta (promedio)
Total de tokens de salida
Puntuación vs Total de tokens de salida
Desglose por categoría
Trucos anti-IA
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
8.7Puntaje promedio en todas las pruebas de benchmark.…
7.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
91.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.16sTiempo de respuesta (máximo)3.44sTiempo de respuesta (total)12.65sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.16sTiempo de respuesta (promedio)…
268Tokens de salida…
7,583Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
8.7Puntaje promedio en todas las pruebas de benchmark.…
7.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
91.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.81sTiempo de respuesta (máximo)5.65sTiempo de respuesta (total)7.62sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.81sTiempo de respuesta (promedio)…
108Tokens de salida…
4,741Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
7.3Puntaje promedio en todas las pruebas de benchmark.…
5.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)4.75sTiempo de respuesta (máximo)7.62sTiempo de respuesta (total)19.00sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.75sTiempo de respuesta (promedio)…
479Tokens de salida…
1,103Tokens de razonamiento…
Programación
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)31.36sTiempo de respuesta (máximo)31.36sTiempo de respuesta (total)31.36sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
31.36sTiempo de respuesta (promedio)…
81Tokens de salida…
3,987Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
2.3Puntaje promedio en todas las pruebas de benchmark.…
1.1La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)23.58sTiempo de respuesta (máximo)23.58sTiempo de respuesta (total)23.58sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
23.58sTiempo de respuesta (promedio)…
821Tokens de salida…
6,703Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
0msTiempo de respuesta (promedio)…
0Tokens de salida…
0Tokens de razonamiento…
Combinado
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)20.93sTiempo de respuesta (máximo)20.93sTiempo de respuesta (total)20.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
20.93sTiempo de respuesta (promedio)…
227Tokens de salida…
12,212Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)37.64sTiempo de respuesta (máximo)37.64sTiempo de respuesta (total)37.64sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
37.64sTiempo de respuesta (promedio)…
261Tokens de salida…
12,272Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
4.7Puntaje promedio en todas las pruebas de benchmark.…
1.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Tiempo de respuesta (promedio)30.53sTiempo de respuesta (máximo)30.53sTiempo de respuesta (total)30.53sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
30.53sTiempo de respuesta (promedio)…
792Tokens de salida…
3,456Tokens de razonamiento…
Análisis y extracción de datos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.01sTiempo de respuesta (máximo)4.27sTiempo de respuesta (total)8.02sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.01sTiempo de respuesta (promedio)…
180Tokens de salida…
5,281Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.63sTiempo de respuesta (máximo)6.63sTiempo de respuesta (total)6.63sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.63sTiempo de respuesta (promedio)…
180Tokens de salida…
5,409Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)23.16sTiempo de respuesta (máximo)26.55sTiempo de respuesta (total)46.33sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
23.16sTiempo de respuesta (promedio)…
1,488Tokens de salida…
8,017Tokens de razonamiento…
Específico del dominio
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)21.33sTiempo de respuesta (máximo)24.21sTiempo de respuesta (total)64.00sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
21.33sTiempo de respuesta (promedio)…
251Tokens de salida…
40,255Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.8Puntaje promedio en todas las pruebas de benchmark.…
4.4La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)121.79sTiempo de respuesta (máximo)121.79sTiempo de respuesta (total)121.79sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
121.79sTiempo de respuesta (promedio)…
11Tokens de salida…
37,657Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1Tiempo agotado: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)10.52sTiempo de respuesta (máximo)18.68sTiempo de respuesta (total)31.56sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.52sTiempo de respuesta (promedio)…
892Tokens de salida…
2,406Tokens de razonamiento…
Inteligencia general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.78sTiempo de respuesta (máximo)5.78sTiempo de respuesta (total)5.78sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.78sTiempo de respuesta (promedio)…
72Tokens de salida…
3,440Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
4.2Puntaje promedio en todas las pruebas de benchmark.…
9.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)16.25sTiempo de respuesta (máximo)16.25sTiempo de respuesta (total)16.25sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
16.25sTiempo de respuesta (promedio)…
127Tokens de salida…
3,456Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
7.0Puntaje promedio en todas las pruebas de benchmark.…
3.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)6.44sTiempo de respuesta (máximo)6.44sTiempo de respuesta (total)6.44sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.44sTiempo de respuesta (promedio)…
116Tokens de salida…
260Tokens de razonamiento…
Seguimiento de instrucciones
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.89sTiempo de respuesta (máximo)5.89sTiempo de respuesta (total)9.78sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.89sTiempo de respuesta (promedio)…
703Tokens de salida…
67,771Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)4.63sTiempo de respuesta (máximo)4.63sTiempo de respuesta (total)4.63sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.63sTiempo de respuesta (promedio)…
662Tokens de salida…
21,680Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
9.9Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.18sTiempo de respuesta (máximo)4.46sTiempo de respuesta (total)8.36sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.18sTiempo de respuesta (promedio)…
208Tokens de salida…
465Tokens de razonamiento…
Resolución de acertijos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.52sTiempo de respuesta (máximo)4.53sTiempo de respuesta (total)10.57sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.52sTiempo de respuesta (promedio)…
2,950Tokens de salida…
31,874Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)7.40sTiempo de respuesta (máximo)7.79sTiempo de respuesta (total)14.81sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.40sTiempo de respuesta (promedio)…
853Tokens de salida…
30,338Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
6.1Puntaje promedio en todas las pruebas de benchmark.…
4.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)5.35sTiempo de respuesta (máximo)6.20sTiempo de respuesta (total)16.06sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.35sTiempo de respuesta (promedio)…
2,223Tokens de salida…
8,198Tokens de razonamiento…
Llamada de herramientas
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)12.39sTiempo de respuesta (máximo)12.39sTiempo de respuesta (total)12.39sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
12.39sTiempo de respuesta (promedio)…
183Tokens de salida…
5,384Tokens de razonamiento…
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
2.8Puntaje promedio en todas las pruebas de benchmark.…
1.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)27.71sTiempo de respuesta (máximo)27.71sTiempo de respuesta (total)27.71sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
27.71sTiempo de respuesta (promedio)…
260Tokens de salida…
11,485Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)17.33sTiempo de respuesta (máximo)17.33sTiempo de respuesta (total)17.33sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
17.33sTiempo de respuesta (promedio)…
308Tokens de salida…
904Tokens de razonamiento…
Cultura general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de salida
Tokens de razonamiento
Grok 4.20 BetaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
-
-
-
-
-
-
-
-
Grok 4.1 FastModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)25.52sTiempo de respuesta (máximo)25.52sTiempo de respuesta (total)25.52sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
25.52sTiempo de respuesta (promedio)…
15Tokens de salida…
5,381Tokens de razonamiento…
Hunter AlphaModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.