Ranking de falhas por Formatação extra

Veja quais modelos de IA encontram Formatação extra com mais frequência para identificar riscos de confiabilidade antes de escolher.

Modelos exibidos

Falhas totais

Modelo mais afetado

Claude Opus 4.6 5

Categorias

Na categoria Truques anti-IA20 Na categoria Programação18 Na categoria Específico do domínio17 Na categoria Resolução de quebra-cabeças7 Na categoria Análise e extração de dados6 Na categoria Seguimento de instruções3 Na categoria Combinado1

41/41

Posição	Modelo	Empresa	Contagem de Formatação extra	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#43	Claude Opus 4.6 medium	Anthropic	5	7.7	$3.059	13/22	34.3s
Total de testes 22 Testes errados 9 Custo total $3.059 Tempo de resposta (médio) 34.3s
#62	Claude Sonnet 4.6 none	Anthropic	4	7.3	$0.661	12/22	8.12s
Total de testes 22 Testes errados 10 Custo total $0.661 Tempo de resposta (médio) 8.12s
#108	Claude Sonnet 5 none	Anthropic	4	6.3	$0.548	8/22	6.04s
Total de testes 22 Testes errados 14 Custo total $0.548 Tempo de resposta (médio) 6.04s
#154	KAT-Coder-Air V2.5 low	Kwaipilot	4	5.4	$0.041	7/22	10.1s
Total de testes 22 Testes errados 15 Custo total $0.041 Tempo de resposta (médio) 10.1s
#40	Claude Sonnet 4.6 medium	Anthropic	3	7.8	$2.057	14/22	25.9s
Total de testes 22 Testes errados 8 Custo total $2.057 Tempo de resposta (médio) 25.9s
#48	Grok Build 0.1 medium	X AI	3	7.6	$1.097	14/22	52.1s
Total de testes 22 Testes errados 8 Custo total $1.097 Tempo de resposta (médio) 52.1s
#65	Claude Opus 4.8 none	Anthropic	3	7.3	$1.166	13/22	4.91s
Total de testes 22 Testes errados 9 Custo total $1.166 Tempo de resposta (médio) 4.91s
#83	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Total de testes 22 Testes errados 10 Custo total $0.187 Tempo de resposta (médio) 33.9s
#140	KAT-Coder-Air V2.5 high	Kwaipilot	3	5.6	$0.077	7/22	15.9s
Total de testes 22 Testes errados 15 Custo total $0.077 Tempo de resposta (médio) 15.9s
#178	KAT-Coder-Air V2.5 none	Kwaipilot	3	4.8	$0.067	5/22	12.2s
Total de testes 22 Testes errados 17 Custo total $0.067 Tempo de resposta (médio) 12.2s
#98	MiMo-V2.5 medium	Xiaomi	2	6.5	$0.082	12/22	32.2s
Total de testes 22 Testes errados 10 Custo total $0.082 Tempo de resposta (médio) 32.2s
#133	North Mini Code medium	Cohere	2	5.9	$0.000	9/22	137.1s
Total de testes 22 Testes errados 13 Custo total $0.000 Tempo de resposta (médio) 137.1s
#146	DeepSeek V4 Flash none	DeepSeek	2	5.6	$0.044	5/22	36.8s
Total de testes 22 Testes errados 17 Custo total $0.044 Tempo de resposta (médio) 36.8s
#167	North Mini Code none	Cohere	2	5.1	$0.000	4/22	29.9s
Total de testes 22 Testes errados 18 Custo total $0.000 Tempo de resposta (médio) 29.9s
#169	DeepSeek V3.2 none	DeepSeek	2	5.0	$0.054	6/22	18.3s
Total de testes 22 Testes errados 16 Custo total $0.054 Tempo de resposta (médio) 18.3s

Falhas por Formatação extra

Filtrar modelos

Melhores modelos por Contagem de Formatação extra

Contagem de Formatação extra vs Pontuação

Melhores modelos por Tempo de resposta (médio)