Ranking de falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↑.

Modelos exibidos

Falhas totais

1585

Modelo mais afetado

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Categorias

Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3

215/215

Posição	Modelo	Empresa	Contagem de Resposta incorreta	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#174	MiMo-V2.5 none	Xiaomi	14	5.1	$0.025	5/22	4.62s
Total de testes 22 Testes errados 17 Custo total $0.025 Tempo de resposta (médio) 4.62s
#202	Hunter Alpha none	OpenRouter	9	4.2	$0.000	6/18	4.70s
Total de testes 18 Testes errados 12 Custo total $0.000 Tempo de resposta (médio) 4.70s
#109	Qwen3.5-27B none	Qwen	12	6.5	$0.090	8/22	4.76s
Total de testes 22 Testes errados 14 Custo total $0.090 Tempo de resposta (médio) 4.76s
#70	Claude Opus 4.8 none	Anthropic	4	7.3	$1.166	13/22	4.91s
Total de testes 22 Testes errados 9 Custo total $1.166 Tempo de resposta (médio) 4.91s
#123	GPT-5.6 Luna low	OpenAI	10	6.2	$0.249	10/22	5.04s
Total de testes 22 Testes errados 12 Custo total $0.249 Tempo de resposta (médio) 5.04s
#129	Inkling low	Thinkingmachines	8	6.1	$0.187	10/22	5.15s
Total de testes 22 Testes errados 12 Custo total $0.187 Tempo de resposta (médio) 5.15s
#117	LongCat 2.0 none	Meituan	14	6.3	$0.044	7/22	5.18s
Total de testes 22 Testes errados 15 Custo total $0.044 Tempo de resposta (médio) 5.18s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Total de testes 22 Testes errados 9 Custo total $0.519 Tempo de resposta (médio) 5.31s
#121	Gemma 4 31B none	Google	9	6.2	$0.021	10/22	5.34s
Total de testes 22 Testes errados 12 Custo total $0.021 Tempo de resposta (médio) 5.34s
#167	Qwen3.6 35B A3B none	Qwen	13	5.3	$0.061	4/22	5.52s
Total de testes 22 Testes errados 18 Custo total $0.061 Tempo de resposta (médio) 5.52s
#14	Gemini 3.5 Flash low	Google	2	8.9	$0.433	19/22	5.55s
Total de testes 22 Testes errados 3 Custo total $0.433 Tempo de resposta (médio) 5.55s
#183	Nemotron 3 Super none	NVIDIA	15	4.9	$0.008	5/22	5.97s
Total de testes 22 Testes errados 17 Custo total $0.008 Tempo de resposta (médio) 5.97s
#104	Gemini 3.5 Flash-Lite medium	Google	9	6.5	$0.369	12/22	6.01s
Total de testes 22 Testes errados 10 Custo total $0.369 Tempo de resposta (médio) 6.01s
#118	Claude Sonnet 5 none	Anthropic	7	6.3	$0.548	8/22	6.04s
Total de testes 22 Testes errados 14 Custo total $0.548 Tempo de resposta (médio) 6.04s
#124	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
Total de testes 22 Testes errados 13 Custo total $0.017 Tempo de resposta (médio) 6.20s

Falhas por Resposta incorreta

Filtrar modelos

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)