AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Anthropic: Claude Opus 4.8

Resumen

Comparación benchmark de Claude Opus 4.7 (medium) vs Claude Opus 4.8 (medium): Claude Opus 4.8 (medium) lidera en puntuación media con 8.8 vs 8.7. Claude Opus 4.7 (medium) tiene menor coste de benchmark con $0.679 vs $1.107. Claude Opus 4.7 (medium) es más rápido con 4.73s vs 9.72s, con tasas de acierto de 82.5% vs 84.1%.

Modelo recomendado: Claude Opus 4.7 (medium) - Su puntuación se mantiene cerca de la mejor aquí (8.7 vs 8.8) y cuesta aproximadamente 1.6x menos que Claude Opus 4.8 (medium).

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-10

Métrica	Claude Opus 4.7 Claude Opus 4.7 medium Lanzamiento: 2026-04-16	Claude Opus 4.8 Claude Opus 4.8 medium Lanzamiento: 2026-05-28

Métrica	Claude Opus 4.7 Claude Opus 4.7 medium Lanzamiento: 2026-04-16	Claude Opus 4.8 Claude Opus 4.8 medium Lanzamiento: 2026-05-28
Puntuación	8.7	8.8
Rango	#16	#15
Fiabilidad	10.0	10.0
Consistencia	9.6	9.6
Pruebas correctas
Tasa de aciertos por intento	82.5%	84.1%
Pruebas inestables	1	1
Ejecuciones totales	63	63
Costo por resultado	3.991	6.512
Costo total	$0.679	$1.107
Precio de entrada	$5.000 / 1M	$5.000 / 1M
Precio de salida	$25.000 / 1M	$25.000 / 1M
Total de tokens de entrada	65,406	61,007
Tokens de salida	11,858	26,495
Tokens de razonamiento	2,198	5,901
Tiempo de respuesta (promedio)	4.73s	9.72s
Tiempo de respuesta (máximo)	23.18s	38.03s
Tiempo de respuesta (total)	94.51s	204.19s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 Claude Opus 4.7

medium

Coste: $0.059
Tiempo: 26.8s
Tokens: 2,475 tok

#15 Claude Opus 4.8

medium

Coste: $0.057
Tiempo: 23.1s
Tokens: 2,412 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	8.3	10.0	75.0%	0		1.85s	894	348	0
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	7.6	7.2	77.8%	1		12.96s	10,635	7,629	1,114
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		21.45s	24,501	2,369	1,084
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		2.37s	10,533	324	0
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	7.7	10.0	66.7%	0		1.17s	630	51	0
Claude Opus 4.8	5.3	10.0	33.3%	0		14.59s	975	7,477	900

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		2.87s	723	256	0
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		1.57s	939	114	0
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		2.43s	939	370	0
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	10.0	10.0	100.0%	0		4.17s	15,339	373	0
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.7	3.0	10.0	0.0%	0		2.25s	273	24	0
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214

Comparación rápida

Cambiar par de comparación

Claude Opus 4.7mediumvsGPT-5.2 Chatnone Claude Opus 4.8mediumvsGPT-5.2 Chatnone Claude Opus 4.8mediumvsGemini 3.5 Flashlow Claude Opus 4.7mediumvsDeepSeek V4 Flashhigh Claude Opus 4.8mediumvsGPT-5.5low Claude Opus 4.8mediumvsGPT-5.6 Solhigh Claude Opus 4.7mediumvsGPT-5.6 Terrahigh Claude Opus 4.7mediumvsGemini 3.5 Flashlow Claude Opus 4.8mediumvsDeepSeek V4 Flashhigh Claude Opus 4.7mediumvsGPT-5.5low Claude Opus 4.7mediumvsGPT-5.6 Solhigh Claude Opus 4.8mediumvsGPT-5.6 Terrahigh