Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↑.

Modelos exibidos

Falhas totais

1585

Modelo mais afetado

LFM2-24B-A2B 9

Categorias

Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

215/215

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#126	Gemini 3.1 Flash Lite minimal	Google	8	6.1	$0.047	10/22	1.86s
Total de testes 22 Testes errados 12 Custo total $0.047 Tempo de resposta (médio) 1.86s
#124	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
Total de testes 22 Testes errados 13 Custo total $0.017 Tempo de resposta (médio) 6.20s
#125	Qwen3.5-35B-A3B medium	Qwen	2	6.2	$0.837	11/22	112.5s
Total de testes 22 Testes errados 11 Custo total $0.837 Tempo de resposta (médio) 112.5s
#123	GPT-5.6 Luna low	OpenAI	10	6.2	$0.249	10/22	5.04s
Total de testes 22 Testes errados 12 Custo total $0.249 Tempo de resposta (médio) 5.04s
#122	Seed-2.0-Lite none	Bytedance Seed	13	6.2	$0.066	8/22	4.40s
Total de testes 22 Testes errados 14 Custo total $0.066 Tempo de resposta (médio) 4.40s
#121	Gemma 4 31B none	Google	9	6.2	$0.021	10/22	5.34s
Total de testes 22 Testes errados 12 Custo total $0.021 Tempo de resposta (médio) 5.34s
#120	Qwen3.5-Flash medium	Qwen	4	6.2	$0.139	12/22	84.8s
Total de testes 22 Testes errados 10 Custo total $0.139 Tempo de resposta (médio) 84.8s
#119	MiMo-V2-Flash medium	Xiaomi	5	6.3	$0.043	12/21	20.1s
Total de testes 21 Testes errados 9 Custo total $0.043 Tempo de resposta (médio) 20.1s
#118	Claude Sonnet 5 none	Anthropic	7	6.3	$0.548	8/22	6.04s
Total de testes 22 Testes errados 14 Custo total $0.548 Tempo de resposta (médio) 6.04s
#117	LongCat 2.0 none	Meituan	14	6.3	$0.044	7/22	5.18s
Total de testes 22 Testes errados 15 Custo total $0.044 Tempo de resposta (médio) 5.18s
#116	Gemma 4 31B medium	Google	2	6.3	$0.107	14/22	75.4s
Total de testes 22 Testes errados 8 Custo total $0.107 Tempo de resposta (médio) 75.4s
#115	Mimo V2 PRO medium	Xiaomi	5	6.3	$0.333	12/21	22.2s
Total de testes 21 Testes errados 9 Custo total $0.333 Tempo de resposta (médio) 22.2s
#114	Ring-2.6-1T medium	Inclusionai	6	6.3	$0.103	11/22	68.7s
Total de testes 22 Testes errados 11 Custo total $0.103 Tempo de resposta (médio) 68.7s
#113	Qwen3.5 Plus 2026-02-15 none	Qwen	12	6.4	$0.073	10/22	9.85s
Total de testes 22 Testes errados 12 Custo total $0.073 Tempo de resposta (médio) 9.85s
#112	Gemini 3.1 Flash Lite Preview none	Google	7	6.4	$0.052	12/22	1.58s
Total de testes 22 Testes errados 10 Custo total $0.052 Tempo de resposta (médio) 1.58s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)