Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Modelos comparados

Resumen

Comparación benchmark DeepSeek V4 Flash vs DeepSeek V4 Pro vs GLM 5GLM 5 lidera en Puntuación con 8.6. DeepSeek V4 Flash lidera en Fiabilidad con 10.0. DeepSeek V4 Flash tiene el Costo total más bajo con $0.027. GLM 5 es el más rápido con 33.54s.

Modelo recomendado: DeepSeek V4 Flash - Su puntuación se mantiene cerca de la mejor aquí (8.3 vs 8.6) y cuesta aproximadamente 7.3x menos que los otros modelos de esta comparación.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-18

Métrica DeepSeek V4 Flash DeepSeek V4 Flash high Lanzamiento: 2026-04-24 DeepSeek V4 Pro DeepSeek V4 Pro high Lanzamiento: 2026-04-24 GLM 5 GLM 5 medium Lanzamiento: 2026-02-12
Puntuación 8.3 7.6 8.6
Rango #23 #41 #15
Fiabilidad 10.0 9.3 10.0
Consistencia 8.5 7.0 8.5
Pruebas correctas
Tasa de aciertos por intento 74.6% 66.7% 82.5%
Pruebas inestables 4 8 4
Ejecuciones totales 63 63 63
Costo por resultado 0.299 1.742 1.668
Costo total $0.027 $0.157 $0.228
Precio de entrada $0.090 / 1M $0.435 / 1M $0.600 / 1M
Precio de salida $0.180 / 1M $0.870 / 1M $1.920 / 1M
Total de tokens de entrada 39,745 38,726 35,224
Tokens de salida 10,310 6,334 21,570
Tokens de razonamiento 123,501 159,151 102,996
Tiempo de respuesta (promedio) 45.85s 77.20s 33.54s
Tiempo de respuesta (máximo) 218.13s 416.76s 99.85s
Tiempo de respuesta (total) 962.79s 1621.17s 435.99s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 DeepSeek V4 Flash

high
Coste
$0.003
Tiempo
93.1s
Tokens
7,926 tok

#41 DeepSeek V4 Pro

high
Coste
$0.023
Tiempo
257.6s
Tokens
14,870 tok

#15 GLM 5

medium
Coste
$0.005
Tiempo
20.7s
Tokens
2,068 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 8.3 10.0 75.0% 0 28.51s 540 140 7,770
DeepSeek V4 Pro 5.7 5.9 58.3% 2 25.70s 536 149 3,214
GLM 5 10.0 10.0 100.0% 0 23.66s 555 480 7,056
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 7.8 10.0 66.7% 0 50.60s 7,279 395 34,862
DeepSeek V4 Pro 6.1 4.6 66.7% 2 243.00s 5,090 383 84,580
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 10.0 10.0 100.0% 0 76.57s 14,016 465 7,347
DeepSeek V4 Pro 10.0 10.0 100.0% 0 38.17s 14,060 454 5,836
GLM 5 10.0 10.0 100.0% 0 28.96s 12,804 662 3,242
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 10.0 10.0 100.0% 0 28.03s 7,290 201 1,179
DeepSeek V4 Pro 10.0 10.0 100.0% 0 25.03s 7,690 274 2,166
GLM 5 7.1 5.6 83.3% 1 8.90s 5,508 567 3,734
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 4.1 4.4 44.5% 2 100.31s 666 27 59,249
DeepSeek V4 Pro 3.6 7.2 22.2% 1 151.46s 569 4,404 50,391
GLM 5 3.5 4.4 33.3% 2 0ms 260 13,176 14,137
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 6.1 3.1 66.7% 1 25.15s 471 79 632
DeepSeek V4 Pro 10.0 10.0 100.0% 0 8.83s 471 115 1,013
GLM 5 6.1 3.1 66.7% 1 14.69s 477 2,020 2,248
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 10.0 10.0 100.0% 0 15.36s 627 63 1,622
DeepSeek V4 Pro 7.8 6.6 83.3% 1 8.73s 627 66 2,726
GLM 5 10.0 10.0 100.0% 0 7.25s 636 1,001 2,129
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 8.2 7.2 88.9% 1 26.11s 594 196 1,767
DeepSeek V4 Pro 6.9 4.9 77.8% 2 56.85s 591 178 2,563
GLM 5 10.0 10.0 100.0% 0 11.33s 609 33 4,076
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 10.0 10.0 100.0% 0 74.73s 8,079 228 542
DeepSeek V4 Pro 9.8 10.0 100.0% 0 15.92s 8,909 295 701
GLM 5 10.0 10.0 100.0% 0 15.93s 6,935 233 994
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
DeepSeek V4 Flash 3.0 10.0 0.0% 0 54.46s 183 8,516 8,531
DeepSeek V4 Pro 3.0 10.0 0.0% 0 34.01s 183 16 5,961
GLM 5 3.0 10.0 0.0% 0 67.37s 186 401 12,450

Comparación rápida

Cambiar par de comparación