AI BENCHY Compare

Anthropic: Claude Sonnet 5 vs Mistral: Mistral Small 4

Resumo

Comparação benchmark Claude Sonnet 5 vs Mistral Small 4: Claude Sonnet 5 lidera na pontuação média com 5.7 vs 5.1. Mistral Small 4 tem menor custo de benchmark com $0.068 vs $0.287. Claude Sonnet 5 é mais rápido com 4.74s vs 9.40s, com taxas de acerto de 42.9% vs 44.4%.

Modelo recomendado: Mistral Small 4 - A pontuação fica perto da melhor aqui (5.1 vs 5.7) e custa cerca de 4.3x menos que Claude Sonnet 5.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-30

Métrica	Claude Sonnet 5 Claude Sonnet 5 none Lançamento: 2026-06-30	Mistral Small 4 Mistral Small 4 medium Lançamento: 2026-03-16

Métrica	Claude Sonnet 5 Claude Sonnet 5 none Lançamento: 2026-06-30	Mistral Small 4 Mistral Small 4 medium Lançamento: 2026-03-16
Pontuação	5.7	5.1
Posição	#117	#136
Confiabilidade	10.0	10.0
Consistência	8.6	6.9
Testes corretos
Taxa de acerto por tentativa	42.9%	44.4%
Testes instáveis	4	8
Execuções totais	63	63
Custo por resultado	4.098	1.344
Custo total	$0.287	$0.068
Preço de entrada	$2.000 / 1M	$0.150 / 1M
Preço de saída	$10.000 / 1M	$0.600 / 1M
Total de tokens de entrada	76,797	42,576
Tokens de saída	13,325	24,184
Tokens de raciocínio	0	84,678
Tempo de resposta (médio)	4.74s	9.40s
Tempo de resposta (máx.)	29.46s	59.15s
Tempo de resposta (total)	99.46s	197.39s

Geração showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#117 Claude Sonnet 5

none

Custo: $0.061
Tempo: 53.7s
Tokens: 6,172 tok

#136 Mistral Small 4

medium

Custo: $0.006
Tempo: 47.9s
Tokens: 9,857 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	5.3	10.0	25.0%	0		3.60s	834	1,813	0
Mistral Small 4	5.6	3.8	66.7%	3		2.67s	708	4,055	4,778

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	4.6	7.9	22.2%	1		3.67s	10,590	1,864	0
Mistral Small 4	4.4	5.1	33.3%	2		39.98s	7,636	11,635	54,715

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	3.0	10.0	0.0%	0		29.46s	38,775	6,340	0
Mistral Small 4	3.0	10.0	0.0%	0		25.25s	18,706	2,612	10,700

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	10.0	10.0	100.0%	0		3.01s	10,503	309	0
Mistral Small 4	7.3	5.9	83.3%	1		1.23s	6,171	335	723

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	5.3	7.2	44.4%	1		3.28s	975	933	0
Mistral Small 4	5.3	7.2	44.4%	1		6.11s	742	2,621	6,904

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	4.7	3.1	33.3%	1		2.81s	708	272	0
Mistral Small 4	4.8	10.0	0.0%	0		2.05s	519	821	828

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	6.4	10.0	50.0%	0		2.58s	909	103	0
Mistral Small 4	7.3	5.8	83.3%	1		1.38s	729	540	1,031

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	6.0	7.4	55.6%	1		3.22s	894	778	0
Mistral Small 4	3.4	9.7	0.0%	0		2.17s	735	1,226	2,632

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	10.0	10.0	100.0%	0		6.80s	12,351	522	0
Mistral Small 4	10.0	10.0	100.0%	0		3.50s	6,420	321	810

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Claude Sonnet 5	3.0	10.0	0.0%	0		4.31s	258	391	0
Mistral Small 4	3.0	10.0	0.0%	0		5.92s	210	18	1,557

Comparação rápida

Trocar par de comparação