Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↑.

Modelos exibidos

Falhas totais

1558

Modelo mais afetado

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Categorias

Na categoria Específico do domínio412 Na categoria Truques anti-IA293 Na categoria Programação252 Na categoria Resolução de quebra-cabeças201 Na categoria Conhecimentos gerais168 Na categoria Combinado68 Na categoria Seguimento de instruções61 Na categoria Inteligência geral59 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

209/209

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#208	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	9	3.2	$0.000	2/19	728ms
Total de testes 19 Testes errados 17 Custo total $0.000 Tempo de resposta (médio) 728ms
#210	LFM2-24B-A2B none	Liquid	9	2.2	$0.001	2/16	782ms
Total de testes 16 Testes errados 14 Custo total $0.001 Tempo de resposta (médio) 782ms
#205	Laguna Xs.2 none	Poolside	8	3.8	$0.004	5/19	806ms
Total de testes 19 Testes errados 14 Custo total $0.004 Tempo de resposta (médio) 806ms
#189	Mercury 2 none	Inception	17	4.6	$0.030	4/22	829ms
Total de testes 22 Testes errados 18 Custo total $0.030 Tempo de resposta (médio) 829ms
#197	Grok 4.20 none	X AI	10	4.1	$0.057	6/18	1.11s
Total de testes 18 Testes errados 12 Custo total $0.057 Tempo de resposta (médio) 1.11s
#191	Grok 4.20 Beta none	X AI	10	4.4	$0.087	6/18	1.19s
Total de testes 18 Testes errados 12 Custo total $0.087 Tempo de resposta (médio) 1.19s
#165	Mistral Small 4 none	Mistral	16	5.1	$0.022	5/22	1.20s
Total de testes 22 Testes errados 17 Custo total $0.022 Tempo de resposta (médio) 1.20s
#193	Elephant Alpha none	Openrouter	9	4.3	$0.000	5/21	1.22s
Total de testes 21 Testes errados 16 Custo total $0.000 Tempo de resposta (médio) 1.22s
#195	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Total de testes 21 Testes errados 15 Custo total $0.000 Tempo de resposta (médio) 1.27s
#201	Granite 4.1 8B none	IBM Granite	13	4.0	$0.007	2/22	1.45s
Total de testes 22 Testes errados 20 Custo total $0.007 Tempo de resposta (médio) 1.45s
#159	GPT-5.6 Luna none	OpenAI	14	5.4	$0.142	6/22	1.50s
Total de testes 22 Testes errados 16 Custo total $0.142 Tempo de resposta (médio) 1.50s
#136	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
Total de testes 22 Testes errados 16 Custo total $0.095 Tempo de resposta (médio) 1.53s
#160	Laguna XS 2.1 none	Poolside	14	5.3	$0.008	5/22	1.55s
Total de testes 22 Testes errados 17 Custo total $0.008 Tempo de resposta (médio) 1.55s
#106	Gemini 3.1 Flash Lite Preview none	Google	7	6.4	$0.052	12/22	1.58s
Total de testes 22 Testes errados 10 Custo total $0.052 Tempo de resposta (médio) 1.58s
#203	Grok 4.1 Fast none	X AI	13	3.8	$0.008	3/19	1.62s
Total de testes 19 Testes errados 16 Custo total $0.008 Tempo de resposta (médio) 1.62s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)