Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↑.

Modelos exibidos

Falhas totais

1585

Modelo mais afetado

LFM2-24B-A2B 9

Categorias

Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

215/215

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
Total de testes 22 Testes errados 11 Custo total $0.387 Tempo de resposta (médio) 19.5s
#65	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
Total de testes 22 Testes errados 6 Custo total $0.177 Tempo de resposta (médio) 6.28s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
Total de testes 22 Testes errados 10 Custo total $0.478 Tempo de resposta (médio) 136.6s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Total de testes 22 Testes errados 7 Custo total $0.197 Tempo de resposta (médio) 4.52s
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
Total de testes 22 Testes errados 9 Custo total $1.627 Tempo de resposta (médio) 111.9s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	4	7.5	$0.437	14/22	89.2s
Total de testes 22 Testes errados 8 Custo total $0.437 Tempo de resposta (médio) 89.2s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
Total de testes 22 Testes errados 10 Custo total $0.756 Tempo de resposta (médio) 25.9s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Total de testes 22 Testes errados 9 Custo total $0.519 Tempo de resposta (médio) 5.31s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
Total de testes 22 Testes errados 9 Custo total $0.571 Tempo de resposta (médio) 6.88s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Total de testes 22 Testes errados 10 Custo total $0.138 Tempo de resposta (médio) 13.2s
#56	Kimi K2.7 Code medium	Moonshot AI	5	7.5	$0.740	12/22	84.2s
Total de testes 22 Testes errados 10 Custo total $0.740 Tempo de resposta (médio) 84.2s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
Total de testes 22 Testes errados 9 Custo total $0.774 Tempo de resposta (médio) 32.2s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Total de testes 22 Testes errados 8 Custo total $0.352 Tempo de resposta (médio) 7.28s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Total de testes 21 Testes errados 7 Custo total $0.323 Tempo de resposta (médio) 23.0s
#52	Grok Build 0.1 medium	X AI	5	7.6	$1.097	14/22	52.1s
Total de testes 22 Testes errados 8 Custo total $1.097 Tempo de resposta (médio) 52.1s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)