Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher.
Categorias
Na categoria Específico do domínio412 Na categoria Truques anti-IA293 Na categoria Programação252 Na categoria Resolução de quebra-cabeças201 Na categoria Conhecimentos gerais168 Na categoria Combinado68 Na categoria Seguimento de instruções61 Na categoria Inteligência geral59 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3
209/209
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #124 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.74s |
| #126 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.6s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 12 | 6.1 | $0.106 | 7/22 | 12.7s |
| #129 | Nemotron 3 Ultra none | NVIDIA | 12 | 6.1 | $0.095 | 8/22 | 3.87s |
| #141 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.044 | 5/22 | 36.8s |
| #162 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.58s |
| #167 | Mistral Small 4 medium | Mistral | 12 | 5.1 | $0.096 | 5/22 | 10.8s |
| #171 | North Mini Code none | Cohere | 12 | 5.1 | $0.000 | 4/22 | 29.9s |
| #183 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #87 | GPT-5.5 none | OpenAI | 11 | 6.9 | $0.544 | 11/22 | 2.36s |
| #102 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #122 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #132 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.349 | 8/22 | 1.65s |
| #138 | Kimi K2.6 none | Moonshot AI | 11 | 5.8 | $0.184 | 7/22 | 19.6s |