Falhas por Não seguiu as instruções
Veja quais modelos de IA encontram Não seguiu as instruções com mais frequência para identificar riscos de confiabilidade antes de escolher.
Categorias
Na categoria Resolução de quebra-cabeças128 Na categoria Inteligência geral115 Na categoria Seguimento de instruções48 Na categoria Truques anti-IA44 Na categoria Programação29 Na categoria Chamada de ferramentas12 Na categoria Análise e extração de dados7 Na categoria Específico do domínio2 Na categoria Combinado1
215/215
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Não seguiu as instruções | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #197 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.280 | 8/22 | 1.66s |
| #209 | GPT-5.4 none | OpenAI | 1 | 5.8 | $0.397 | 7/22 | 2.08s |
| #215 | Ling-3.0-flash none | Inclusionai | 1 | 5.7 | $0.004 | 6/22 | 3.56s |
| #226 | KAT-Coder-Air V2.5 medium | Kwaipilot | 1 | 5.6 | $0.048 | 8/22 | 8.65s |
| #228 | Hy4 preview low | Tencent | 1 | 5.6 | $1.745 | 3/22 | 214.3s |
| #231 | Qwen3.8 27B none | Qwen | 1 | 5.5 | ~$0.006 | 9/22 | 3.12s |
| #232 | Mimo V2 Omni none | Xiaomi | 1 | 5.5 | $0.021 | 8/21 | 2.44s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 1 | 5.4 | $0.037 | 4/22 | 36.2s |
| #234 | Laguna S 2.1 medium | Poolside | 1 | 5.4 | $0.053 | 4/22 | 58.4s |
| #240 | Laguna S 2.1 high | Poolside | 1 | 5.4 | $0.114 | 4/22 | 111.6s |
| #241 | Inkling Small none | Thinkingmachines | 1 | 5.3 | $0.054 | 5/22 | 1.51s |
| #242 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #245 | Gemini 3.1 Flash Lite Preview high | 1 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #248 | Inkling none | Thinkingmachines | 1 | 5.2 | $0.147 | 6/22 | 3.47s |
| #249 | Granite 4.2 8B medium | IBM Granite | 1 | 5.2 | $0.009 | 7/22 | 46.0s |