Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↓.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #201 | Grok 4.20 Beta medium | X AI | 3 | 6.0 | $0.750 | 14/18 | 9.75s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #155 | GLM 5.2 none | Z.ai | 7 | 6.7 | $0.153 | 13/22 | 9.65s |
| #211 | GLM 5.3 Flash low | Z.ai | 8 | 5.9 | $0.015 | 10/22 | 9.65s |
| #288 | Qwen3 Coder Next medium | Qwen | 14 | 4.6 | $0.034 | 3/22 | 9.07s |
| #203 | Gemini 3 PRO Preview medium | 3 | 6.0 | $0.385 | 14/21 | 9.05s | |
| #8 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.357 | 18/22 | 9.04s |
| #280 | GLM 4.7 Flash none | Z.ai | 14 | 4.8 | $0.016 | 5/22 | 8.81s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #259 | Qwen3 Coder Next none | Qwen | 14 | 5.1 | $0.026 | 5/22 | 8.63s |
| #249 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.59s |
| #26 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #14 | GPT-6 Astra medium | OpenAI | 3 | 9.4 | $1.774 | 19/22 | 8.08s |
| #174 | Qwen3.6 Max Preview none | Qwen | 11 | 6.4 | $0.228 | 11/22 | 7.82s |
| #72 | GPT-5.2 Chat none | OpenAI | 6 | 7.9 | $0.594 | 13/22 | 7.73s |