Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↓.

Modelos exibidos

Falhas totais

1585

Modelo mais afetado

Gemini 3.6 Flash 1

Categorias

Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

215/215

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#152	Owl Alpha medium	Openrouter	10	5.6	$0.000	8/21	11.9s
Total de testes 21 Testes errados 13 Custo total $0.000 Tempo de resposta (médio) 11.9s
#153	Mimo V2 PRO none	Xiaomi	11	5.6	$0.045	7/21	2.27s
Total de testes 21 Testes errados 14 Custo total $0.045 Tempo de resposta (médio) 2.27s
#154	Owl Alpha none	Openrouter	10	5.6	$0.000	7/21	9.88s
Total de testes 21 Testes errados 14 Custo total $0.000 Tempo de resposta (médio) 9.88s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	11	5.6	$0.048	8/22	8.42s
Total de testes 22 Testes errados 14 Custo total $0.048 Tempo de resposta (médio) 8.42s
#156	DeepSeek V4 Flash none	DeepSeek	12	5.6	$0.042	5/22	36.8s
Total de testes 22 Testes errados 17 Custo total $0.042 Tempo de resposta (médio) 36.8s
#157	GLM 5.1 none	Z.ai	13	5.5	$0.164	7/22	6.70s
Total de testes 22 Testes errados 15 Custo total $0.164 Tempo de resposta (médio) 6.70s
#158	Qwen3.6 27B none	Qwen	11	5.5	$0.087	7/22	10.7s
Total de testes 22 Testes errados 15 Custo total $0.087 Tempo de resposta (médio) 10.7s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
Total de testes 21 Testes errados 11 Custo total $0.015 Tempo de resposta (médio) 24.6s
#160	MiMo-V2.5-Pro none	Xiaomi	11	5.5	$0.068	6/22	4.12s
Total de testes 22 Testes errados 16 Custo total $0.068 Tempo de resposta (médio) 4.12s
#161	Kimi K2.5 none	Moonshot AI	15	5.5	$0.127	6/22	19.2s
Total de testes 22 Testes errados 16 Custo total $0.127 Tempo de resposta (médio) 19.2s
#162	Gemma 4 26B A4B none	Google	10	5.5	$0.015	8/22	7.64s
Total de testes 22 Testes errados 14 Custo total $0.015 Tempo de resposta (médio) 7.64s
#163	Mimo V2 Omni none	Xiaomi	10	5.5	$0.021	8/21	2.44s
Total de testes 21 Testes errados 13 Custo total $0.021 Tempo de resposta (médio) 2.44s
#164	KAT-Coder-Air V2.5 low	Kwaipilot	7	5.4	$0.041	7/22	10.1s
Total de testes 22 Testes errados 15 Custo total $0.041 Tempo de resposta (médio) 10.1s
#165	GPT-5.6 Luna none	OpenAI	14	5.4	$0.142	6/22	1.50s
Total de testes 22 Testes errados 16 Custo total $0.142 Tempo de resposta (médio) 1.50s
#166	Laguna XS 2.1 none	Poolside	14	5.3	$0.008	5/22	1.55s
Total de testes 22 Testes errados 17 Custo total $0.008 Tempo de resposta (médio) 1.55s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)