Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

Resumen

Comparación benchmark de Claude Opus 4.8 vs GPT-5.5: GPT-5.5 lidera en puntuación media con 9.0 vs 7.7. Claude Opus 4.8 tiene menor coste de benchmark con $1.270 vs $3.679. Claude Opus 4.8 es más rápido con 10.83s vs 37.98s, con tasas de acierto de 79.4% vs 87.3%.

Modelo recomendado: Claude Opus 4.8 - Ofrece el mejor equilibrio general: puntuación competitiva (7.7), menor coste que GPT-5.5 y tiempo de respuesta equilibrado.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-02

Métrica Claude Opus 4.8 Claude Opus 4.8 low Lanzamiento: 2026-05-28 GPT-5.5 GPT-5.5 medium Lanzamiento: 2026-04-24
Puntuación 7.7 9.0
Rango #38 #9
Fiabilidad 10.0 10.0
Consistencia 8.8 8.9
Pruebas correctas
Tasa de aciertos por intento 79.4% 87.3%
Pruebas inestables 3 3
Ejecuciones totales 63 63
Costo por resultado 8.466 21.638
Costo total $1.270 $3.679
Precio de entrada $5.000 / 1M $5.000 / 1M
Precio de salida $25.000 / 1M $30.000 / 1M
Total de tokens de entrada 60,946 34,212
Tokens de salida 31,771 1,985
Tokens de razonamiento 6,831 114,925
Tiempo de respuesta (promedio) 10.83s 37.98s
Tiempo de respuesta (máximo) 127.97s 332.10s
Tiempo de respuesta (total) 227.39s 797.60s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low
Coste
$0.031
Tiempo
14.1s
Tokens
1,345 tok

#9 GPT-5.5

medium
Coste
$0.112
Tiempo
71.9s
Tokens
3,807 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 10.0 10.0 100.0% 0 3.30s 834 793 371
GPT-5.5 10.0 10.0 100.0% 0 4.66s 606 250 1,335
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 9.8 10.0 100.0% 0 20.84s 23,500 2,216 1,081
GPT-5.5 10.0 10.0 100.0% 0 19.29s 11,019 312 2,841
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 6.3 5.8 66.7% 1 2.27s 10,503 310 0
GPT-5.5 10.0 10.0 100.0% 0 4.18s 7,140 234 593
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 5.3 10.0 33.3% 0 45.53s 975 23,311 3,908
GPT-5.5 5.3 7.2 44.4% 1 164.14s 723 67 79,625
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 10.0 10.0 100.0% 0 2.55s 708 231 0
GPT-5.5 10.0 10.0 100.0% 0 4.16s 477 138 223
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 9.8 10.0 100.0% 0 2.78s 909 111 221
GPT-5.5 10.0 10.0 100.0% 0 3.36s 660 93 538
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 10.0 10.0 100.0% 0 3.01s 894 592 184
GPT-5.5 10.0 10.0 100.0% 0 6.76s 642 241 2,225
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 10.0 10.0 100.0% 0 6.85s 11,775 370 35
GPT-5.5 10.0 10.0 100.0% 0 10.57s 5,445 258 832
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Opus 4.8 3.0 10.0 0.0% 0 5.48s 258 200 222
GPT-5.5 2.8 1.6 33.3% 1 37.86s 195 30 1,754

Comparación rápida

Cambiar par de comparación