7.38Puntaje promedio en todas las pruebas de benchmark.…
7.12Puntaje promedio en todas las pruebas de benchmark.…
7.92Puntaje promedio en todas las pruebas de benchmark.…
7.87Puntaje promedio en todas las pruebas de benchmark.…
Consistencia
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.99La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.44La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Costo por resultado
0.162Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
0.403Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
17.455Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
0.624Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
Costo total
$0.017Costo total…
$0.037Costo total…
$1.920Costo total…
$0.069Costo total…
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.89sTiempo de respuesta (máximo)9.54sTiempo de respuesta (total)43.35sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4No siguió las instrucciones: 2Tiempo de respuesta (promedio)3.74sTiempo de respuesta (máximo)12.98sTiempo de respuesta (total)56.15sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3No siguió las instrucciones: 1Tiempo de respuesta (promedio)69.85sTiempo de respuesta (máximo)232.25sTiempo de respuesta (total)1047.79sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3No siguió las instrucciones: 1Tiempo de respuesta (promedio)6.32sTiempo de respuesta (máximo)14.72sTiempo de respuesta (total)94.86sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
60.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
73.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
75.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Tokens de salida
1,392Tokens de salida…
1,417Tokens de salida…
943Tokens de salida…
1,274Tokens de salida…
Tokens de razonamiento
6,379Tokens de razonamiento…
19,435Tokens de razonamiento…
1,275,768Tokens de razonamiento…
18,372Tokens de razonamiento…
Mejores modelos por puntuación
Puntuación vs costo total
Desglose por categoría
Trucos anti-IA
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
7.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.18sTiempo de respuesta (máximo)3.18sTiempo de respuesta (total)6.53sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
456Tokens de salida…
1,224Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
9.00Puntaje promedio en todas las pruebas de benchmark.…
9.99La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.53sTiempo de respuesta (máximo)3.89sTiempo de respuesta (total)7.58sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
564Tokens de salida…
3,780Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)43.87sTiempo de respuesta (máximo)121.88sTiempo de respuesta (total)131.62sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
144Tokens de salida…
193,077Tokens de razonamiento…
Google: Gemini 3 Flash Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.50sTiempo de respuesta (máximo)4.31sTiempo de respuesta (total)10.49sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
275Tokens de salida…
2,476Tokens de razonamiento…
Combinado
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
1.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.96sTiempo de respuesta (máximo)2.96sTiempo de respuesta (total)2.96sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
75Tokens de salida…
253Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)12.98sTiempo de respuesta (máximo)12.98sTiempo de respuesta (total)12.98sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
109Tokens de salida…
2,449Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)232.25sTiempo de respuesta (máximo)232.25sTiempo de respuesta (total)232.25sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
112Tokens de salida…
126,813Tokens de razonamiento…
Google: Gemini 3 Flash Preview
1.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.96sTiempo de respuesta (máximo)2.96sTiempo de respuesta (total)2.96sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
104Tokens de salida…
0Tokens de razonamiento…
Análisis y extracción de datos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
9.88Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.00sTiempo de respuesta (máximo)3.74sTiempo de respuesta (total)5.99sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
291Tokens de salida…
696Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
9.88Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.29sTiempo de respuesta (máximo)2.31sTiempo de respuesta (total)4.59sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
279Tokens de salida…
2,952Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
9.88Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.16sTiempo de respuesta (máximo)8.54sTiempo de respuesta (total)14.31sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
279Tokens de salida…
6,186Tokens de razonamiento…
Google: Gemini 3 Flash Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.46sTiempo de respuesta (máximo)14.72sTiempo de respuesta (total)18.92sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
305Tokens de salida…
3,004Tokens de razonamiento…
Específico del dominio
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
4.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.36sTiempo de respuesta (máximo)3.51sTiempo de respuesta (total)7.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
18Tokens de salida…
1,212Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
1.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)4.21sTiempo de respuesta (máximo)5.86sTiempo de respuesta (total)12.62sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
18Tokens de salida…
5,325Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
4.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)127.58sTiempo de respuesta (máximo)133.93sTiempo de respuesta (total)382.74sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
18Tokens de salida…
566,202Tokens de razonamiento…
Google: Gemini 3 Flash Preview
4.00Puntaje promedio en todas las pruebas de benchmark.…
7.21La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)8.05sTiempo de respuesta (máximo)14.40sTiempo de respuesta (total)24.15sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
12Tokens de salida…
6,410Tokens de razonamiento…
Seguimiento de instrucciones
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
8.50Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.49sTiempo de respuesta (máximo)1.66sTiempo de respuesta (total)2.99sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
72Tokens de salida…
753Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
8.00Puntaje promedio en todas las pruebas de benchmark.…
9.99La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.91sTiempo de respuesta (máximo)1.93sTiempo de respuesta (total)3.82sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
72Tokens de salida…
2,121Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
8.00Puntaje promedio en todas las pruebas de benchmark.…
9.96La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)70.07sTiempo de respuesta (máximo)136.53sTiempo de respuesta (total)140.14sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
69Tokens de salida…
190,053Tokens de razonamiento…
Google: Gemini 3 Flash Preview
7.50Puntaje promedio en todas las pruebas de benchmark.…
9.99La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)7.02sTiempo de respuesta (máximo)7.35sTiempo de respuesta (total)14.03sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
71Tokens de salida…
2,752Tokens de razonamiento…
Puzzle Solving
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.76sTiempo de respuesta (máximo)5.08sTiempo de respuesta (total)8.27sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
243Tokens de salida…
1,248Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
7.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.58sTiempo de respuesta (máximo)4.41sTiempo de respuesta (total)10.75sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
141Tokens de salida…
1,896Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
7.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)46.33sTiempo de respuesta (máximo)134.22sTiempo de respuesta (total)139.00sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
87Tokens de salida…
190,953Tokens de razonamiento…
Google: Gemini 3 Flash Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.44sTiempo de respuesta (máximo)10.27sTiempo de respuesta (total)19.32sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
273Tokens de salida…
3,315Tokens de razonamiento…
Llamada de herramientas
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tokens de salida
Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.54sTiempo de respuesta (máximo)9.54sTiempo de respuesta (total)9.54sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
237Tokens de salida…
993Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.80sTiempo de respuesta (máximo)3.80sTiempo de respuesta (total)3.80sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
234Tokens de salida…
912Tokens de razonamiento…
Google: Gemini 3.1 Flash Lite Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.73sTiempo de respuesta (máximo)7.73sTiempo de respuesta (total)7.73sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
234Tokens de salida…
2,484Tokens de razonamiento…
Google: Gemini 3 Flash Preview
10.00Puntaje promedio en todas las pruebas de benchmark.…
10.00La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.99sTiempo de respuesta (máximo)4.99sTiempo de respuesta (total)4.99sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…