Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #223 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.283 | 6/22 | 12.9s |
| #238 | DeepSeek V4 Flash 0423 none | DeepSeek | 13 | 5.4 | $0.039 | 4/22 | 36.2s |
| #239 | Laguna S 2.1 medium | Poolside | 13 | 5.4 | $0.053 | 4/22 | 58.4s |
| #244 | DeepSeek V4 Flash 0731 none | DeepSeek | 13 | 5.4 | $0.011 | 4/22 | 20.7s |
| #251 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |
| #253 | Inkling none | Thinkingmachines | 13 | 5.2 | $0.147 | 6/22 | 3.47s |
| #255 | Nemotron 3.5 Lightning medium | NVIDIA | 13 | 5.1 | $0.156 | 5/22 | 70.1s |
| #257 | Mistral Small 4 medium | Mistral | 13 | 5.1 | $0.097 | 5/22 | 10.8s |
| #262 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #279 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.070 | 5/22 | 12.5s |
| #301 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #302 | Ling 3.0 Tiny none | Inclusionai | 13 | 4.0 | $0.000 | 2/22 | 14.0s |
| #303 | Granite 4.1 8B none | IBM Granite | 13 | 4.0 | $0.007 | 2/22 | 1.44s |
| #308 | Grok 4.1 Fast none | X AI | 13 | 3.8 | $0.008 | 3/19 | 1.62s |
| #195 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.73s |