Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Testes corretos ↑.
Categorias
Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3
215/215
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #85 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 9 | 6.9 | $0.467 | 11/22 | 24.0s |
| #87 | GPT-5.6 Sol none | OpenAI | 10 | 6.9 | $0.524 | 11/22 | 2.16s |
| #90 | Step 3.7 Flash high | Stepfun | 6 | 6.9 | $1.207 | 11/22 | 64.7s |
| #91 | GPT-5.5 none | OpenAI | 11 | 6.9 | $0.544 | 11/22 | 2.36s |
| #97 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.476 | 11/22 | 25.6s |
| #114 | Ring-2.6-1T medium | Inclusionai | 6 | 6.3 | $0.103 | 11/22 | 68.7s |
| #125 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.2 | $0.837 | 11/22 | 112.5s |
| #215 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |
| #98 | GLM 5V Turbo medium | Z.ai | 7 | 6.7 | $0.457 | 11/21 | 23.1s |
| #136 | Step 3.5 Flash medium | Stepfun | 4 | 6.0 | $0.108 | 11/21 | 174.2s |
| #141 | Hy3 preview high | Tencent | 3 | 5.9 | $0.048 | 11/21 | 56.6s |
| #29 | GPT-5 Mini medium | OpenAI | 5 | 8.1 | $0.237 | 12/22 | 27.6s |
| #30 | Muse Spark 1.1 high | Meta | 4 | 8.1 | $1.694 | 12/22 | 31.5s |
| #51 | MiniMax M3 medium | Minimax | 3 | 7.6 | $0.286 | 12/22 | 75.0s |
| #56 | Kimi K2.7 Code medium | Moonshot AI | 5 | 7.5 | $0.740 | 12/22 | 84.2s |