Falhas por Não seguiu as instruções
Veja quais modelos de IA encontram Não seguiu as instruções com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↑.
141/141
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Não seguiu as instruções | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #190 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #158 | Qwen3.6 27B none | Qwen | 2 | 5.5 | $0.087 | 7/22 | 10.7s |
| #184 | Ling-2.6-flash none | Inclusionai | 2 | 4.9 | $0.002 | 6/22 | 10.7s |
| #173 | Mistral Small 4 medium | Mistral | 2 | 5.1 | $0.096 | 5/22 | 10.8s |
| #27 | Muse Spark 1.1 low | Meta | 2 | 8.3 | $0.647 | 13/22 | 11.5s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.9 | $0.096 | 10/22 | 11.6s |
| #152 | Owl Alpha medium | Openrouter | 2 | 5.6 | $0.000 | 8/21 | 11.9s |
| #75 | Qwen3.7 Plus none | Qwen | 1 | 7.2 | $0.106 | 11/22 | 12.1s |
| #26 | Claude Sonnet 5 medium | Anthropic | 1 | 8.3 | $0.922 | 16/22 | 12.5s |
| #133 | Qwen3.5-35B-A3B none | Qwen | 2 | 6.1 | $0.106 | 7/22 | 12.7s |
| #148 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.7 | $0.247 | 6/22 | 12.9s |
| #205 | Hy3 preview none | Tencent | 4 | 4.0 | $0.003 | 4/21 | 12.9s |
| #57 | GPT-5.4 Nano medium | OpenAI | 2 | 7.5 | $0.138 | 12/22 | 13.2s |
| #132 | Qwen3.5 Plus 2026-04-20 none | Qwen | 2 | 6.1 | $0.122 | 8/22 | 13.6s |
| #192 | Laguna M.1 medium | Poolside | 1 | 4.7 | $0.033 | 9/19 | 14.7s |