Navegación
AI BENCHY
Advertise here

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs StepFun: Step 3.5 Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-08

Métrica Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Lanzamiento: 2026-05-08 Step 3.5 Flash Step 3.5 Flash medium Lanzamiento: 2026-02-01
Puntuación 7.6 7.6
Rango #44 #43
Fiabilidad 10.0 10.0
Consistencia 9.2 9.2
Pruebas correctas
Tasa de aciertos por intento 68.4% 66.7%
Pruebas inestables 2 2
Ejecuciones totales 57 54
Costo por resultado 0.203 0.099
Costo total $0.025 $0.011
Precio de entrada $0.250 / 1M $0.100 / 1M
Precio de salida $1.500 / 1M $0.300 / 1M
Tokens de salida 2,702 78,299
Tokens de razonamiento 8,596 173,409
Tiempo de respuesta (promedio) 1.92s 41.66s
Tiempo de respuesta (máximo) 5.66s 170.45s
Tiempo de respuesta (total) 36.49s 499.91s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 7.3 6.2 75.0% 2 1.84s 1,013 1,548
Step 3.5 Flash 10.0 10.0 100.0% 0 40.57s 20,391 24,176
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.46s 441 408
Step 3.5 Flash - - - - - - - -
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 4.48s 348 975
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.44s 291 697
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 5.3 10.0 33.3% 0 1.52s 15 1,214
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 45,350 90,436
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 4.0 10.0 0.0% 0 1.37s 69 438
Step 3.5 Flash 5.5 10.0 0.0% 0 22.39s 240 3,506
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.52s 72 760
Step 3.5 Flash 8.5 6.8 83.3% 1 4.98s 2,284 3,412
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.40s 210 1,191
Step 3.5 Flash 5.3 10.0 33.3% 0 7.72s 5,629 10,835
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 5.66s 234 945
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 1.46s 9 420
Step 3.5 Flash 3.0 10.0 0.0% 0 108.45s 2,354 10,372

Comparación rápida

Cambiar par de comparación