Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Testes corretos ↑.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.1s |
| #198 | Nemotron 3 Ultra none | NVIDIA | 11 | 6.1 | $0.093 | 8/22 | 3.88s |
| #199 | Trinity Large Thinking low | Arcee AI | 7 | 6.0 | $0.625 | 8/22 | 96.6s |
| #200 | Gemini 2.5 Flash none | 13 | 6.0 | $0.017 | 8/22 | 6.19s | |
| #202 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.280 | 8/22 | 1.66s |
| #204 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #208 | Dots 3 Note Preview medium | Dots Studio | 9 | 5.9 | $0.000 | 8/22 | 67.1s |
| #216 | North Mini Code medium | Cohere | 9 | 5.7 | $0.000 | 8/22 | 142.0s |
| #217 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.050 | 8/22 | 52.3s |
| #221 | GLM 5.1 none | Z.ai | 12 | 5.7 | $0.164 | 8/22 | 6.74s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #305 | Grok Build 0.1 none | X AI | 7 | 4.0 | $0.547 | 7/19 | 28.7s |
| #226 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |
| #227 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #237 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |