Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher.

Modelos exibidos

Falhas totais

1558

Modelo mais afetado

Mercury 2 17

Categorias

Na categoria Específico do domínio412 Na categoria Truques anti-IA293 Na categoria Programação252 Na categoria Resolução de quebra-cabeças201 Na categoria Conhecimentos gerais168 Na categoria Combinado68 Na categoria Seguimento de instruções61 Na categoria Inteligência geral59 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

209/209

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#136	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
Total de testes 22 Testes errados 16 Custo total $0.095 Tempo de resposta (médio) 1.53s
#142	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Total de testes 22 Testes errados 16 Custo total $0.247 Tempo de resposta (médio) 12.9s
#151	GLM 5.1 none	Z.ai	13	5.5	$0.164	7/22	6.70s
Total de testes 22 Testes errados 15 Custo total $0.164 Tempo de resposta (médio) 6.70s
#161	Qwen3.6 35B A3B none	Qwen	13	5.3	$0.061	4/22	5.52s
Total de testes 22 Testes errados 18 Custo total $0.061 Tempo de resposta (médio) 5.52s
#164	Inkling none	Thinkingmachines	13	5.2	$0.147	6/22	3.50s
Total de testes 22 Testes errados 16 Custo total $0.147 Tempo de resposta (médio) 3.50s
#170	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
Total de testes 21 Testes errados 15 Custo total $0.047 Tempo de resposta (médio) 2.82s
#176	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
Total de testes 22 Testes errados 16 Custo total $0.016 Tempo de resposta (médio) 9.15s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	13	4.8	$0.067	5/22	12.2s
Total de testes 22 Testes errados 17 Custo total $0.067 Tempo de resposta (médio) 12.2s
#187	Qwen3 Coder Next medium	Qwen	13	4.7	$0.032	4/22	9.61s
Total de testes 22 Testes errados 18 Custo total $0.032 Tempo de resposta (médio) 9.61s
#200	MiMo-V2-Flash none	Xiaomi	13	4.0	$0.025	4/21	2.76s
Total de testes 21 Testes errados 17 Custo total $0.025 Tempo de resposta (médio) 2.76s
#201	Granite 4.1 8B none	IBM Granite	13	4.0	$0.007	2/22	1.45s
Total de testes 22 Testes errados 20 Custo total $0.007 Tempo de resposta (médio) 1.45s
#203	Grok 4.1 Fast none	X AI	13	3.8	$0.008	3/19	1.62s
Total de testes 19 Testes errados 16 Custo total $0.008 Tempo de resposta (médio) 1.62s
#103	Qwen3.5-27B none	Qwen	12	6.5	$0.090	8/22	4.76s
Total de testes 22 Testes errados 14 Custo total $0.090 Tempo de resposta (médio) 4.76s
#107	Qwen3.5 Plus 2026-02-15 none	Qwen	12	6.4	$0.073	10/22	9.85s
Total de testes 22 Testes errados 12 Custo total $0.073 Tempo de resposta (médio) 9.85s
#118	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
Total de testes 22 Testes errados 13 Custo total $0.017 Tempo de resposta (médio) 6.20s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)