Ranking de falhas por Não seguiu as instruções

Veja quais modelos de IA encontram Não seguiu as instruções com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Testes corretos ↓.

Modelos exibidos

Falhas totais

250

Modelo mais afetado

Gemini 3.5 Flash 1

Categorias

Na categoria Resolução de quebra-cabeças90 Na categoria Inteligência geral78 Na categoria Truques anti-IA33 Na categoria Seguimento de instruções23 Na categoria Programação16 Na categoria Chamada de ferramentas8 Na categoria Combinado1 Na categoria Específico do domínio1

145/145

Posição	Modelo	Empresa	Contagem de Não seguiu as instruções	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#194	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Total de testes 19 Testes errados 10 Custo total $0.069 Tempo de resposta (médio) 23.8s
#195	Laguna M.1 medium	Poolside	1	4.7	$0.033	9/19	14.7s
Total de testes 19 Testes errados 10 Custo total $0.033 Tempo de resposta (médio) 14.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Total de testes 22 Testes errados 12 Custo total $0.200 Tempo de resposta (médio) 79.1s
#81	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Total de testes 22 Testes errados 12 Custo total $0.600 Tempo de resposta (médio) 99.0s
#82	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Total de testes 22 Testes errados 12 Custo total $0.093 Tempo de resposta (médio) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	2	6.9	$0.096	10/22	11.6s
Total de testes 22 Testes errados 12 Custo total $0.096 Tempo de resposta (médio) 11.6s
#96	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Total de testes 22 Testes errados 12 Custo total $0.391 Tempo de resposta (médio) 100.3s
#105	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	10/22	106.3s
Total de testes 22 Testes errados 12 Custo total $0.779 Tempo de resposta (médio) 106.3s
#121	Gemma 4 31B none	Google	1	6.2	$0.021	10/22	5.34s
Total de testes 22 Testes errados 12 Custo total $0.021 Tempo de resposta (médio) 5.34s
#123	GPT-5.6 Luna low	OpenAI	1	6.2	$0.249	10/22	5.04s
Total de testes 22 Testes errados 12 Custo total $0.249 Tempo de resposta (médio) 5.04s
#126	Gemini 3.1 Flash Lite minimal	Google	3	6.1	$0.047	10/22	1.86s
Total de testes 22 Testes errados 12 Custo total $0.047 Tempo de resposta (médio) 1.86s
#129	Inkling low	Thinkingmachines	2	6.1	$0.187	10/22	5.15s
Total de testes 22 Testes errados 12 Custo total $0.187 Tempo de resposta (médio) 5.15s
#190	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
Total de testes 18 Testes errados 10 Custo total $5.599 Tempo de resposta (médio) 9.69s
#193	Hunter Alpha medium	OpenRouter	2	4.7	$0.000	8/18	10.3s
Total de testes 18 Testes errados 10 Custo total $0.000 Tempo de resposta (médio) 10.3s
#102	LongCat 2.0 high	Meituan	2	6.6	$0.469	9/22	148.7s
Total de testes 22 Testes errados 13 Custo total $0.469 Tempo de resposta (médio) 148.7s

Falhas por Não seguiu as instruções

Filtrar modelos

Melhores modelos por Contagem de Não seguiu as instruções

Contagem de Não seguiu as instruções vs Pontuação

Melhores modelos por Tempo de resposta (médio)