AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.4

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-19

Métrica	Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lanzamiento: 2026-02-17	GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05

Métrica	Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lanzamiento: 2026-02-17	GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05
Puntuación	7.8	7.9
Rango	#40	#31
Fiabilidad	10.0	10.0
Consistencia	9.6	8.8
Pruebas correctas
Tasa de aciertos por intento	70.2%	75.4%
Pruebas inestables	1	3
Ejecuciones totales	57	57
Costo por resultado	9.515	6.617
Costo total	$1.237	$0.861
Precio de entrada	$3.000 / 1M	$2.500 / 1M
Precio de salida	$15.000 / 1M	$15.000 / 1M
Tokens de salida	45,505	2,199
Tokens de razonamiento	28,370	50,553
Tiempo de respuesta (promedio)	14.25s	18.38s
Tiempo de respuesta (máximo)	46.35s	100.41s
Tiempo de respuesta (total)	156.71s	349.21s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	6.5	10.0	50.0%	0		2.98s	1,046	1,093
GPT-5.4	8.3	10.0	75.0%	0		4.11s	240	1,511

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		35.76s	6,894	2,097
GPT-5.4	10.0	10.0	100.0%	0		13.03s	389	2,045

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		46.35s	5,871	3,962
GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		13.90s	649	742
GPT-5.4	10.0	10.0	100.0%	0		5.32s	234	804

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	2.9	7.2	11.1%	1		0ms	25,790	16,919
GPT-5.4	5.3	7.2	44.4%	1		74.27s	61	34,748

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.94s	256	433
GPT-5.4	4.7	3.1	33.3%	1		4.92s	145	321

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		2.61s	318	552
GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.80s	589	635
GPT-5.4	8.2	7.2	88.9%	1		9.13s	442	3,832

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	10.0	10.0	100.0%	0		7.48s	655	351
GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Sonnet 4.6	3.0	10.0	0.0%	0		30.09s	3,437	1,586
GPT-5.4	3.0	10.0	0.0%	0		13.95s	30	1,821

Comparación rápida

Cambiar par de comparación

Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewlow Claude Sonnet 4.6mediumvsGemini 3 Flash Previewnone Gemini 3 Flash PreviewnonevsGPT-5.4medium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Sonnet 4.6mediumvsGPT-5.2 Chatnone Claude Sonnet 4.6mediumvsGemini 3.1 Flash Litelow Gemini 3.5 FlashminimalvsGPT-5.4medium Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsDeepSeek V4 FlashhighDisponible gratis Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4medium Gemini 3.1 Flash LitelowvsGPT-5.4medium