Ranking de falhas por Não seguiu as instruções

Veja quais modelos de IA encontram Não seguiu as instruções com mais frequência para identificar riscos de confiabilidade antes de escolher.

Modelos exibidos

Falhas totais

242

Modelo mais afetado

MiniMax M2.7 5

Categorias

Na categoria Resolução de quebra-cabeças88 Na categoria Inteligência geral78 Na categoria Truques anti-IA32 Na categoria Seguimento de instruções18 Na categoria Programação16 Na categoria Chamada de ferramentas8 Na categoria Combinado1 Na categoria Específico do domínio1

138/138

Posição	Modelo	Empresa	Contagem de Não seguiu as instruções	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#168	MiniMax M2.7 medium	Minimax	5	5.0	$0.163	5/22	41.3s
Total de testes 22 Testes errados 17 Custo total $0.163 Tempo de resposta (médio) 41.3s
#150	MiMo-V2.5-Pro none	Xiaomi	4	5.5	$0.068	6/22	4.12s
Total de testes 22 Testes errados 16 Custo total $0.068 Tempo de resposta (médio) 4.12s
#181	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Total de testes 19 Testes errados 10 Custo total $0.069 Tempo de resposta (médio) 23.8s
#195	Hy3 preview none	Tencent	4	4.0	$0.003	4/21	12.9s
Total de testes 21 Testes errados 17 Custo total $0.003 Tempo de resposta (médio) 12.9s
#197	Granite 4.1 8B none	IBM Granite	4	4.0	$0.007	2/22	1.45s
Total de testes 22 Testes errados 20 Custo total $0.007 Tempo de resposta (médio) 1.45s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Total de testes 22 Testes errados 8 Custo total $0.951 Tempo de resposta (médio) 22.6s
#26	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
Total de testes 22 Testes errados 10 Custo total $0.237 Tempo de resposta (médio) 27.6s
#56	GPT-5.4 Mini medium	OpenAI	3	7.5	$0.756	12/22	25.9s
Total de testes 22 Testes errados 10 Custo total $0.756 Tempo de resposta (médio) 25.9s
#77	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Total de testes 22 Testes errados 12 Custo total $0.093 Tempo de resposta (médio) 2.72s
#116	Gemini 3.1 Flash Lite minimal	Google	3	6.1	$0.047	10/22	1.86s
Total de testes 22 Testes errados 12 Custo total $0.047 Tempo de resposta (médio) 1.86s
#117	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Total de testes 22 Testes errados 13 Custo total $0.019 Tempo de resposta (médio) 21.9s
#126	Step 3.5 Flash medium	Stepfun	3	6.0	$0.108	11/21	174.2s
Total de testes 21 Testes errados 10 Custo total $0.108 Tempo de resposta (médio) 174.2s
#132	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
Total de testes 22 Testes errados 16 Custo total $0.095 Tempo de resposta (médio) 1.53s
#134	Kimi K2.6 none	Moonshot AI	3	5.8	$0.233	7/22	19.6s
Total de testes 22 Testes errados 15 Custo total $0.233 Tempo de resposta (médio) 19.6s
#136	Nemotron 3 Super medium	NVIDIA	3	5.7	$0.066	8/22	52.0s
Total de testes 22 Testes errados 14 Custo total $0.066 Tempo de resposta (médio) 52.0s

Falhas por Não seguiu as instruções

Filtrar modelos

Melhores modelos por Contagem de Não seguiu as instruções

Contagem de Não seguiu as instruções vs Pontuação

Melhores modelos por Tempo de resposta (médio)