Gemini 3 PRO Preview (medium) lidera en puntuación media con 6.0 vs 5.6. GLM 5V Turbo tiene menor coste de benchmark con $0.052 vs $0.385. GLM 5V Turbo es más rápido con 2.99s vs 9.05s, con tasas de acierto de 63.6% vs 36.4%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-09-22
Modelos comparados
Rango
#225
Total de tokens de salida
11,592
Tiempo de respuesta (promedio)
9.05s
Costo total
$0.385
Rango
#248
Total de tokens de salida
1,766
Tiempo de respuesta (promedio)
2.99s
Costo total
$0.052
Modelo recomendadoGemini 3 PRO Preview (medium)
Tiene la puntuación más alta en esta comparación (6.0) y el mejor equilibrio general entre coste y tiempo de respuesta en los 2 modelos.
GLM 5V TurboGLM 5V TurbononeModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-04-01
Puntuación
6.0Puntaje promedio en todas las pruebas de benchmark.…
5.6Puntaje promedio en todas las pruebas de benchmark.…
Rango
#225
#248
Fiabilidad
N/DPuntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
9.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Intentos
63/66
63/66
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 4Respuesta incorrecta: 3Tiempo de respuesta (promedio)9.05sTiempo de respuesta (máximo)26.24sTiempo de respuesta (total)90.53sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 11No siguió las instrucciones: 2Tiempo de respuesta (promedio)2.99sTiempo de respuesta (máximo)6.51sTiempo de respuesta (total)62.74sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
63.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
36.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
63Ejecuciones totales…
63Ejecuciones totales…
Costo por resultado
1.406
0.645
Costo total
$0.385
$0.052
Precio de entrada
$9.506 / 1MPrecio de entrada…
$1.200 / 1MPrecio de entrada…
Precio de salida
$9.506 / 1MPrecio de salida…
$4.000 / 1MPrecio de salida…
Total de tokens de entrada
28,848Total de tokens de entrada…
37,100Total de tokens de entrada…
Tokens de salida
1,490Tokens de salida…
1,766Tokens de salida…
Tokens de razonamiento
10,102Tokens de razonamiento…
0Tokens de razonamiento…
Tiempo de respuesta (promedio)
9.05sTiempo de respuesta (promedio)…
2.99sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
26.24sTiempo de respuesta (máximo)…
6.51sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
90.53sTiempo de respuesta (total)…
62.74sTiempo de respuesta (total)…
Parámetros
~1.2T en total (~20B activos)
~106B en total (~12B activos)
Disponibilidad
Código cerrado
Código cerrado
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#225 Gemini 3 PRO Preview
medium
No endpoints found for google/gemini-3-pro-preview.
Coste
$0.000
Tiempo
0.1s
Tokens
0 tok
#248 GLM 5V Turbo
none
Coste
$0.042
Tiempo
177.3s
Tokens
10,434 tok
Rango
-
Coste
-
Tiempo
-
Tokens
-
Mejores modelos por puntuación
Puntuación vs costo total
Tiempo de respuesta (promedio)
Puntuación vs Tiempo de respuesta (promedio)
Total de tokens de salida
Puntuación vs Total de tokens de salida
Desglose por categoría
Trucos anti-IA
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)14.99sTiempo de respuesta (máximo)26.24sTiempo de respuesta (total)29.99sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
14.99sTiempo de respuesta (promedio)…
500Total de tokens de entrada…
149Tokens de salida…
1,485Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
4.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
25.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)3.13sTiempo de respuesta (máximo)5.90sTiempo de respuesta (total)12.50sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.13sTiempo de respuesta (promedio)…
555Total de tokens de entrada…
281Tokens de salida…
0Tokens de razonamiento…
Programación
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 3Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
0msTiempo de respuesta (promedio)…
0Total de tokens de entrada…
0Tokens de salida…
0Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)3.13sTiempo de respuesta (máximo)5.30sTiempo de respuesta (total)9.40sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.13sTiempo de respuesta (promedio)…
7,256Total de tokens de entrada…
360Tokens de salida…
0Tokens de razonamiento…
Combinado
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
1.5Puntaje promedio en todas las pruebas de benchmark.…
5.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)10.37sTiempo de respuesta (máximo)10.37sTiempo de respuesta (total)10.37sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.37sTiempo de respuesta (promedio)…
13,211Total de tokens de entrada…
351Tokens de salida…
952Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
1.5Puntaje promedio en todas las pruebas de benchmark.…
5.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.51sTiempo de respuesta (máximo)6.51sTiempo de respuesta (total)6.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.51sTiempo de respuesta (promedio)…
12,708Total de tokens de entrada…
276Tokens de salida…
0Tokens de razonamiento…
Análisis y extracción de datos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)10.84sTiempo de respuesta (máximo)10.84sTiempo de respuesta (total)10.84sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.84sTiempo de respuesta (promedio)…
7,259Total de tokens de entrada…
279Tokens de salida…
3,156Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.81sTiempo de respuesta (máximo)5.69sTiempo de respuesta (total)7.62sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.81sTiempo de respuesta (promedio)…
7,107Total de tokens de entrada…
204Tokens de salida…
0Tokens de razonamiento…
Específico del dominio
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)7.01sTiempo de respuesta (máximo)7.01sTiempo de respuesta (total)7.01sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.01sTiempo de respuesta (promedio)…
643Total de tokens de entrada…
15Tokens de salida…
1,195Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.09sTiempo de respuesta (máximo)2.39sTiempo de respuesta (total)6.26sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.09sTiempo de respuesta (promedio)…
687Total de tokens de entrada…
24Tokens de salida…
0Tokens de razonamiento…
Inteligencia general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.34sTiempo de respuesta (máximo)9.34sTiempo de respuesta (total)9.34sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.34sTiempo de respuesta (promedio)…
486Total de tokens de entrada…
78Tokens de salida…
374Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
4.6Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.22sTiempo de respuesta (máximo)2.22sTiempo de respuesta (total)2.22sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.22sTiempo de respuesta (promedio)…
477Total de tokens de entrada…
114Tokens de salida…
0Tokens de razonamiento…
Seguimiento de instrucciones
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.26sTiempo de respuesta (máximo)3.26sTiempo de respuesta (total)3.26sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.26sTiempo de respuesta (promedio)…
623Total de tokens de entrada…
69Tokens de salida…
754Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.97sTiempo de respuesta (máximo)2.43sTiempo de respuesta (total)3.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
1.97sTiempo de respuesta (promedio)…
636Total de tokens de entrada…
60Tokens de salida…
0Tokens de razonamiento…
Resolución de acertijos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.88sTiempo de respuesta (máximo)4.23sTiempo de respuesta (total)7.77sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.88sTiempo de respuesta (promedio)…
570Total de tokens de entrada…
225Tokens de salida…
1,215Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.40sTiempo de respuesta (máximo)3.81sTiempo de respuesta (total)7.21sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.40sTiempo de respuesta (promedio)…
609Total de tokens de entrada…
210Tokens de salida…
0Tokens de razonamiento…
Llamada de herramientas
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)11.96sTiempo de respuesta (máximo)11.96sTiempo de respuesta (total)11.96sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
11.96sTiempo de respuesta (promedio)…
5,556Total de tokens de entrada…
324Tokens de salida…
971Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.86sTiempo de respuesta (máximo)4.86sTiempo de respuesta (total)4.86sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.86sTiempo de respuesta (promedio)…
6,879Total de tokens de entrada…
222Tokens de salida…
0Tokens de razonamiento…
Cultura general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Gemini 3 PRO PreviewModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
0msTiempo de respuesta (promedio)…
0Total de tokens de entrada…
0Tokens de salida…
0Tokens de razonamiento…
GLM 5V TurboModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.23sTiempo de respuesta (máximo)2.23sTiempo de respuesta (total)2.23sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…