#35 DeepSeek V4 Flash
high- Coste
- $0.003
- Tiempo
- 93.1s
- Tokens
- 7,926 tok
Resumen
DeepSeek V4 Flash 0423 obtiene 7.7 en AI BENCHY y ocupa el puesto #35. Tiene fiabilidad 10.0, una tasa de aciertos de 74.6%, coste total de $0.028 y tiempo medio de respuesta de 44.95s.
Qué hace único a DeepSeek V4 Flash 0423: Destaca más en Análisis y extracción de datos, donde ocupa #1, mientras que Resolución de acertijos es su área más débil con #16. Su coste total de benchmark es inusualmente bajo para su nivel de puntuación.
Investigado el 2026-08-12
7.7
Consistencia
8.5
10.0
Total de tokens de salida
128,045
Total de tokens de entrada
38,019
Precio de entrada
$0.099 / 1M
Precio de salida
$0.197 / 1M
Pruebas incorrectas: 8
Tasa de aciertos por intento: 74.6%
Cobertura del benchmark: 61/63 intentos
Pruebas inestables
4
Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).
Tiempo de respuesta (promedio)
44.95s
Tiempo de respuesta (máximo): 218.13s
Tiempo de respuesta (total): 944.02s
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
Historial de ejecuciones
| Probado el | Puntuación | Fiabilidad | Pruebas correctas | Costo total | Comparar |
|---|---|---|---|---|---|
| 2026-08-14 03:03 Nueva prueba | 7.6 | 10.0 | $0.066 ↑ | Comparar | |
| 2026-07-16 23:17 Prueba nueva añadida | 7.7 | 10.0 | $0.042 ↓ | Comparar | |
| 2026-06-04 14:24 Nueva prueba | 7.7 | 10.0 | $0.029 ↓ | Comparar | |
| 2026-06-04 13:02 Prueba nueva añadida | 7.7 | 10.0 | $0.028 ↓ | Ejecución actual | |
| 2026-05-22 00:39 Suite modificada | 7.4 | 10.0 | $0.038 | Comparar | |
| 2026-04-25 21:41 Nueva prueba | 7.8 | N/D | $0.031 | Comparar | |
| 2026-04-24 09:19 Primera ejecución | 7.8 | N/D | $0.019 | Comparar |
Esta ejecución usó una suite de benchmark diferente. Ten en cuenta los cambios de suite al interpretar la evolución histórica.
Comparación de ejecuciones
| Ejecución | Cobertura del benchmark | Puntuación | Consistencia | Fiabilidad | Pruebas correctas | Pruebas inestables | Total de tokens de salida | Total de tokens de entrada | Costo total | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-04 13:02 · Prueba nueva añadida | 61/63 intentos | 7.7 | 8.5 | 10.0 | 13/21 | 4 | 128,045 | 38,019 | $0.028 | 44.95s |
| 2026-06-04 14:24 · Nueva prueba | 63/63 intentos | 7.7 | 8.5 | 10.0 | 13/21 | 4 | 133,811 | 39,745 | $0.029 | 45.85s |
| Diferencia | — | 0.0 | 0.0 | 0.0 | 0 | 0 | -5766 | -1726 | -$0.002 | -893ms |
La cobertura del benchmark difiere: 61/63 intentos (Objetivo: 3 repeticiones por prueba) frente a 63/63 intentos (Objetivo: 3 repeticiones por prueba). Los totales y las métricas sensibles a las repeticiones no son directamente comparables.
Historial de precios
Datos históricos de precios de este modelo de OpenRouter.
| Fecha | Precio de entrada | Precio de salida |
|---|---|---|
| 2026-06-04 13:03 | $0.099 / 1M | $0.197 / 1M |
Elige el primer modelo y luego haz clic en un segundo modelo para abrir una página lado a lado.
| Categoría | Puntuación | Consistencia | Pruebas correctas |
|---|---|---|---|
| Trucos anti-IA | 8.3 | 10.0 | |
| Programación | 7.8 | 10.0 | |
| Combinado | 10.0 | 10.0 | |
| Análisis y extracción de datos | 10.0 | 10.0 | |
| Específico del dominio | 4.1 | 4.4 | |
| Inteligencia general | 6.1 | 3.1 | |
| Seguimiento de instrucciones | 10.0 | 10.0 | |
| Resolución de acertijos | 8.2 | 7.2 | |
| Llamada de herramientas | 10.0 | 10.0 | |
| Cultura general | 3.0 | 10.0 |