Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher.
Categorias
Na categoria Específico do domínio412 Na categoria Truques anti-IA293 Na categoria Programação252 Na categoria Resolução de quebra-cabeças201 Na categoria Conhecimentos gerais168 Na categoria Combinado68 Na categoria Seguimento de instruções61 Na categoria Inteligência geral59 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3
209/209
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #66 | Claude Opus 4.8 none | Anthropic | 4 | 7.3 | $1.166 | 13/22 | 4.91s |
| #74 | GLM 5.1 medium | Z.ai | 4 | 7.1 | $0.535 | 13/22 | 46.8s |
| #80 | Seed-2.0-Mini medium | Bytedance Seed | 4 | 7.0 | $0.101 | 11/22 | 92.5s |
| #90 | Qwen3.6 35B A3B medium | Qwen | 4 | 6.7 | $0.746 | 13/22 | 58.1s |
| #114 | Qwen3.5-Flash medium | Qwen | 4 | 6.2 | $0.139 | 12/22 | 84.8s |
| #130 | Step 3.5 Flash medium | Stepfun | 4 | 6.0 | $0.108 | 11/21 | 174.2s |
| #143 | Gemini 3.1 Flash Lite high | 4 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #153 | Hy3 preview low | Tencent | 4 | 5.5 | $0.015 | 10/21 | 24.6s |
| #181 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #184 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #185 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #186 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #6 | GPT-5.5 low | OpenAI | 3 | 9.3 | $1.253 | 19/22 | 10.1s |
| #8 | Qwen3.7 Max medium | Qwen | 3 | 9.2 | $1.116 | 18/22 | 40.6s |
| #14 | Claude Opus 4.8 medium | Anthropic | 3 | 8.8 | $1.931 | 18/22 | 12.5s |