Navegación
AI BENCHY
Advertise here

Inception: Mercury 2 vs Poolside: Laguna S 2.1

Laguna S 2.1 (high) lidera en puntuación media con 5.4 vs 4.6. Mercury 2 tiene menor coste de benchmark con $0.030 vs $0.127. Mercury 2 es más rápido con 829ms vs 111.61s, con tasas de acierto de 22.7% vs 27.3%.

Modelo recomendadoMercury 2Su puntuación se mantiene cerca de la mejor aquí (4.6 vs 5.4) y cuesta aproximadamente 4.3x menos que Laguna S 2.1 (high).
Rango
#204
Tasa de aciertos por intento
22.7%
Total de tokens de salida
9,564
Tiempo de respuesta (promedio)
829ms
Costo total
$0.030
Rango
#173
Tasa de aciertos por intento
27.3%
Total de tokens de salida
584,864
Tiempo de respuesta (promedio)
111.61s
Costo total
$0.127

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-25

Métrica Mercury 2 Mercury 2 none Lanzamiento: 2026-02-24 Laguna S 2.1 Laguna S 2.1 high Lanzamiento: 2026-07-21 Disponible gratis
Puntuación 4.6 5.4
Rango #204 #173
Fiabilidad 10.0 9.9
Consistencia 9.2 8.1
Pruebas correctas
Tasa de aciertos por intento 22.7% 27.3%
Pruebas inestables 2 5
Ejecuciones totales 66 66
Costo por resultado 0.734 3.153
Costo total $0.030 $0.127
Precio de entrada $0.250 / 1M $0.100 / 1M
Precio de salida $0.750 / 1M $0.200 / 1M
Total de tokens de entrada 88,704 208,931
Tokens de salida 9,564 175,588
Tokens de razonamiento 0 409,276
Tiempo de respuesta (promedio) 829ms 111.61s
Tiempo de respuesta (máximo) 4.52s 1190.11s
Tiempo de respuesta (total) 18.24s 2455.39s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#204 Mercury 2

none
Coste
$0.002
Tiempo
1.8s
Tokens
1,514 tok

#173 Laguna S 2.1

high
Coste
$0.001
Tiempo
6.8s
Tokens
1,389 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Laguna S 2.1 5.3 7.2 44.4% 1 271.42s 6,496 59,355 151,009

Comparación rápida

Cambiar par de comparación