Navegación
AI BENCHY
Advertise here

Modelos comparados

Comparación benchmark GPT-5.4 (medium) vs GPT-5.3-Codex (medium) vs GPT-5.2 (medium): GPT-5.3-Codex (medium) lidera en Puntuación con 8.9. GPT-5.4 (medium) lidera en Fiabilidad con 10.0. GPT-5.3-Codex (medium) tiene el Costo total más bajo con $0.920. GPT-5.3-Codex (medium) es el más rápido con 16.96s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-08-07

Rango
#29
Total de tokens de salida
88,670
Tiempo de respuesta (promedio)
23.10s
Costo total
$1.533
Rango
#18
Total de tokens de salida
55,525
Tiempo de respuesta (promedio)
16.96s
Costo total
$0.920
Rango
#33
Total de tokens de salida
54,782
Tiempo de respuesta (promedio)
22.62s
Costo total
$0.951
Modelo recomendado GPT-5.3-Codex (medium)

Tiene la puntuación más alta en esta comparación (8.9) y el mejor equilibrio general entre coste y tiempo de respuesta en los 3 modelos.

Comparación detallada

Métrica GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium Lanzamiento: 2026-02-05 GPT-5.2 GPT-5.2 medium Lanzamiento: 2025-12-11
Puntuación 8.5 8.9 8.4
Rango #29 #18 #33
Fiabilidad 10.0 10.0 10.0
Consistencia 8.6 8.6 8.5
Cobertura del benchmark 22/22 pruebas · 66/66 intentos 22/22 pruebas · 66/66 intentos 22/22 pruebas · 66/66 intentos
Pruebas correctas
Tasa de aciertos por intento 77.3% 83.3% 72.7%
Pruebas inestables 4 4 4
Ejecuciones totales 66 66 66
Costo por resultado 10.220 5.748 6.791
Costo total $1.533 $0.920 $0.951
Precio de entrada $2.500 / 1M $1.750 / 1M $1.750 / 1M
Precio de salida $15.000 / 1M $14.000 / 1M $14.000 / 1M
Total de tokens de entrada 81,127 81,268 105,004
Tokens de salida 6,155 6,251 9,914
Tokens de razonamiento 82,515 49,274 44,868
Tiempo de respuesta (promedio) 23.10s 16.96s 22.62s
Tiempo de respuesta (máximo) 100.41s 100.93s 102.93s
Tiempo de respuesta (total) 508.26s 373.19s 339.28s

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GPT-5.4

medium
Coste
$0.214
Tiempo
199.6s
Tokens
14,349 tok

#18 GPT-5.3-Codex

medium
Coste
$0.049
Tiempo
54.9s
Tokens
3,580 tok

#33 GPT-5.2

medium
Coste
$0.047
Tiempo
49.2s
Tokens
3,396 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

Comparación rápida

Cambiar par de comparación