Navegación
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modelos comparados

Comparación benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): GPT-5.3-Codex (medium) lidera en Puntuación con 9.1. Claude Opus 4.6 (medium) lidera en Fiabilidad con 10.0. GPT-5.3-Codex (medium) tiene el Costo total más bajo con $1.318. GPT-5.3-Codex (medium) es el más rápido con 18.87s.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-10-06

Modelos comparados

Rango
#228
Total de tokens de salida
96,722
Tiempo de respuesta (promedio)
32.23s
Costo total
$2.961
Rango
#212
Total de tokens de salida
120,427
Tiempo de respuesta (promedio)
28.08s
Costo total
$2.126
Rango
#34
Total de tokens de salida
66,287
Tiempo de respuesta (promedio)
18.87s
Costo total
$1.318
Rango
#71
Total de tokens de salida
102,691
Tiempo de respuesta (promedio)
22.71s
Costo total
$1.585
Modelo recomendado GPT-5.3-Codex (medium)

Tiene la mejor puntuación aquí (9.1) y cuesta aproximadamente 1.7x menos que los otros modelos de esta comparación.

Comparación detallada

Métrica Claude Opus 4.6 Claude Opus 4.6 medium Lanzamiento: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lanzamiento: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Lanzamiento: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lanzamiento: 2026-02-19
Puntuación 6.3 6.4 9.1 8.4
Rango #228 #212 #34 #71
Fiabilidad 10.0 10.0 10.0 9.8
Consistencia 8.5 9.1 8.6 9.6
Intentos 66/69 66/69 69/69 69/69
Pruebas correctas
Tasa de aciertos por intento 60.9% 62.3% 84.1% 89.9%
Pruebas inestables 3 1 4 1
Ejecuciones totales 66 66 69 69
Costo por resultado 22.777 15.182 7.753 7.924
Costo total $2.961 $2.126 $1.318 $1.585
Precio de entrada $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Precio de salida $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Precio de lectura de caché $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
Precio de escritura de caché $6.250 / 1M $3.750 / 1M N/D $0.375 / 1M
Total de tokens de entrada 108,573 106,316 222,794 176,208
Tokens de salida 69,994 79,338 7,357 6,093
Tokens de razonamiento 26,728 41,089 58,930 96,598
Tiempo de respuesta (promedio) 32.23s 28.08s 18.87s 22.71s
Tiempo de respuesta (máximo) 151.51s 140.96s 100.93s 88.68s
Tiempo de respuesta (total) 515.65s 421.15s 433.94s 386.11s
Parámetros ~5T en total (~500B activos) ~1T en total (~100B activos) ~1.2T en total (~80B activos) ~1.2T en total (~20B activos)
Disponibilidad Código cerrado Código cerrado Código cerrado Código cerrado

Los precios de caché se aplican a los tokens de entrada. Las lecturas reutilizan instrucciones guardadas; las escrituras las almacenan y pueden costar más. Los tokens de salida usan el precio de salida.

Generación showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok

#34 GPT-5.3-Codex

medium
Coste
$0.049
Tiempo
54.9s
Tokens
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
Coste
$0.115
Tiempo
87.2s
Tokens
9,629 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparación rápida

Cambiar par de comparación