Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 2.5 Flash vs Mistral: Mistral Small 4

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-17

Métrica Gemini 2.5 Flash Gemini 2.5 Flash none Lanzamiento: 2025-06-17 Mistral Small 4 Mistral Small 4 medium Lanzamiento: 2026-03-16
Rango #48 #55
Puntuación 5.9 5.6
Consistencia 9.1 7.0
Costo por resultado 0.192 0.502
Costo total $0.012 $0.026
Pruebas correctas
Tasa de aciertos por intento 41.2% 49.0%
Pruebas inestables 2 6
Ejecuciones totales 51 51
Tokens de salida 1,273 12,288
Tokens de razonamiento 0 28,112
Tiempo de respuesta (promedio) 888ms 4.18s
Tiempo de respuesta (máximo) 4.39s 25.25s
Tiempo de respuesta (total) 15.10s 71.03s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 3.0 10.0 0.0% 0 582ms 102 0
Mistral Small 4 5.6 3.8 66.7% 3 2.67s 4,055 4,778
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 3.0 10.0 0.0% 0 4.39s 366 0
Mistral Small 4 3.0 10.0 0.0% 0 25.25s 2,612 10,700
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 10.0 10.0 100.0% 0 652ms 279 0
Mistral Small 4 7.3 5.9 83.3% 1 1.23s 335 723
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 5.9 7.2 55.6% 1 495ms 12 0
Mistral Small 4 5.3 7.2 44.4% 1 6.11s 2,621 6,904
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 5.0 10.0 0.0% 0 615ms 78 0
Mistral Small 4 4.8 10.0 0.0% 0 2.05s 821 828
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 8.0 6.8 66.7% 1 672ms 70 0
Mistral Small 4 7.3 5.8 83.3% 1 1.38s 540 1,031
Puzzle Solving Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 5.7 10.0 33.3% 0 576ms 132 0
Mistral Small 4 3.4 9.7 0.0% 0 2.00s 983 2,338
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Gemini 2.5 Flash 10.0 10.0 100.0% 0 1.91s 234 0
Mistral Small 4 10.0 10.0 100.0% 0 3.50s 321 810

Comparación rápida

Cambiar par de comparación