AI BENCHY Compare

Anthropic: Claude Sonnet 5 vs Mistral: Mistral Small 4

Resumen

Comparación benchmark de Claude Sonnet 5 vs Mistral Small 4: Claude Sonnet 5 lidera en puntuación media con 5.7 vs 5.1. Mistral Small 4 tiene menor coste de benchmark con $0.068 vs $0.287. Claude Sonnet 5 es más rápido con 4.74s vs 9.40s, con tasas de acierto de 42.9% vs 44.4%.

Modelo recomendado: Mistral Small 4 - Su puntuación se mantiene cerca de la mejor aquí (5.1 vs 5.7) y cuesta aproximadamente 4.3x menos que Claude Sonnet 5.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-30

Métrica	Claude Sonnet 5 Claude Sonnet 5 none Lanzamiento: 2026-06-30	Mistral Small 4 Mistral Small 4 medium Lanzamiento: 2026-03-16

Métrica	Claude Sonnet 5 Claude Sonnet 5 none Lanzamiento: 2026-06-30	Mistral Small 4 Mistral Small 4 medium Lanzamiento: 2026-03-16
Puntuación	5.7	5.1
Rango	#117	#136
Fiabilidad	10.0	10.0
Consistencia	8.6	6.9
Pruebas correctas
Tasa de aciertos por intento	42.9%	44.4%
Pruebas inestables	4	8
Ejecuciones totales	63	63
Costo por resultado	4.098	1.344
Costo total	$0.287	$0.068
Precio de entrada	$2.000 / 1M	$0.150 / 1M
Precio de salida	$10.000 / 1M	$0.600 / 1M
Total de tokens de entrada	76,797	42,576
Tokens de salida	13,325	24,184
Tokens de razonamiento	0	84,678
Tiempo de respuesta (promedio)	4.74s	9.40s
Tiempo de respuesta (máximo)	29.46s	59.15s
Tiempo de respuesta (total)	99.46s	197.39s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#117 Claude Sonnet 5

none

Coste: $0.061
Tiempo: 53.7s
Tokens: 6,172 tok

#136 Mistral Small 4

medium

Coste: $0.006
Tiempo: 47.9s
Tokens: 9,857 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	5.3	10.0	25.0%	0		3.60s	834	1,813	0
Mistral Small 4	5.6	3.8	66.7%	3		2.67s	708	4,055	4,778

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	4.6	7.9	22.2%	1		3.67s	10,590	1,864	0
Mistral Small 4	4.4	5.1	33.3%	2		39.98s	7,636	11,635	54,715

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	3.0	10.0	0.0%	0		29.46s	38,775	6,340	0
Mistral Small 4	3.0	10.0	0.0%	0		25.25s	18,706	2,612	10,700

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	10.0	10.0	100.0%	0		3.01s	10,503	309	0
Mistral Small 4	7.3	5.9	83.3%	1		1.23s	6,171	335	723

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	5.3	7.2	44.4%	1		3.28s	975	933	0
Mistral Small 4	5.3	7.2	44.4%	1		6.11s	742	2,621	6,904

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	4.7	3.1	33.3%	1		2.81s	708	272	0
Mistral Small 4	4.8	10.0	0.0%	0		2.05s	519	821	828

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	6.4	10.0	50.0%	0		2.58s	909	103	0
Mistral Small 4	7.3	5.8	83.3%	1		1.38s	729	540	1,031

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	6.0	7.4	55.6%	1		3.22s	894	778	0
Mistral Small 4	3.4	9.7	0.0%	0		2.17s	735	1,226	2,632

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	10.0	10.0	100.0%	0		6.80s	12,351	522	0
Mistral Small 4	10.0	10.0	100.0%	0		3.50s	6,420	321	810

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Sonnet 5	3.0	10.0	0.0%	0		4.31s	258	391	0
Mistral Small 4	3.0	10.0	0.0%	0		5.92s	210	18	1,557

Comparación rápida

Cambiar par de comparación