Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparación benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) lidera en Puntuación con 9.2. Claude Opus 4.6 (medium) lidera en Fiabilidad con 10.0. GPT-5.3-Codex (medium) tiene el Costo total más bajo con $0.920. GPT-5.3-Codex (medium) es el más rápido con 16.96s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-08-07

Rango
#60
Total de tokens de salida
100,601
Tiempo de respuesta (promedio)
34.27s
Costo total
$3.059
Rango
#56
Total de tokens de salida
115,865
Tiempo de respuesta (promedio)
25.91s
Costo total
$2.057
Rango
#18
Total de tokens de salida
55,525
Tiempo de respuesta (promedio)
16.96s
Costo total
$0.920
Rango
#9
Total de tokens de salida
97,958
Tiempo de respuesta (promedio)
21.47s
Costo total
$1.361
Modelo recomendado GPT-5.3-Codex (medium)

Su puntuación se mantiene cerca de la mejor aquí (8.9 vs 9.2) y cuesta aproximadamente 2.3x menos que los otros modelos de esta comparación.

Comparación detallada

Métrica Claude Opus 4.6 Claude Opus 4.6 medium Lanzamiento: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lanzamiento: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Lanzamiento: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lanzamiento: 2026-02-19
Puntuación 7.7 7.8 8.9 9.2
Rango #60 #56 #18 #9
Fiabilidad 10.0 10.0 10.0 10.0
Consistencia 8.8 9.2 8.6 10.0
Cobertura del benchmark 22/22 pruebas · 66/66 intentos 22/22 pruebas · 66/66 intentos 22/22 pruebas · 66/66 intentos 22/22 pruebas · 66/66 intentos
Pruebas correctas
Tasa de aciertos por intento 63.6% 66.7% 83.3% 90.9%
Pruebas inestables 3 2 4 0
Ejecuciones totales 66 66 66 66
Costo por resultado 23.524 14.692 5.748 6.801
Costo total $3.059 $2.057 $0.920 $1.361
Precio de entrada $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Precio de salida $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Total de tokens de entrada 108,615 106,292 81,268 92,287
Tokens de salida 72,286 80,748 6,251 5,232
Tokens de razonamiento 28,315 35,117 49,274 92,726
Tiempo de respuesta (promedio) 34.27s 25.91s 16.96s 21.47s
Tiempo de respuesta (máximo) 151.51s 140.96s 100.93s 88.68s
Tiempo de respuesta (total) 513.99s 362.78s 373.19s 322.08s

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG inválido
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok

#56 Claude Sonnet 4.6

medium
SVG inválido
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok

#18 GPT-5.3-Codex

medium
Coste
$0.049
Tiempo
54.9s
Tokens
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Coste
$0.115
Tiempo
87.2s
Tokens
9,629 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparación rápida

Cambiar par de comparación