Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↑.
Categorias
Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3
215/215
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #65 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.177 | 16/22 | 6.28s | |
| #157 | GLM 5.1 none | Z.ai | 13 | 5.5 | $0.164 | 7/22 | 6.70s |
| #204 | Laguna Xs.2 medium | Poolside | 6 | 4.1 | $0.015 | 6/19 | 6.73s |
| #58 | GPT-5.3 Chat none | OpenAI | 7 | 7.5 | $0.571 | 13/22 | 6.88s |
| #43 | GPT-5.6 Terra medium | OpenAI | 8 | 7.8 | $0.676 | 14/22 | 7.11s |
| #54 | GPT-5.6 Luna medium | OpenAI | 8 | 7.6 | $0.352 | 14/22 | 7.28s |
| #18 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.477 | 18/22 | 7.61s |
| #162 | Gemma 4 26B A4B none | 10 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #34 | GPT-5.2 Chat none | OpenAI | 6 | 8.0 | $0.604 | 14/22 | 7.65s |
| #103 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #67 | Claude Sonnet 4.6 none | Anthropic | 5 | 7.3 | $0.661 | 12/22 | 8.12s |
| #12 | Gemini 3.5 Flash medium | 2 | 9.1 | $0.642 | 19/22 | 8.20s | |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #168 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.58s |
| #5 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.971 | 18/22 | 8.79s |