Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↓.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #11 | Gemini 3.5 Flash high | 2 | 9.4 | $2.011 | 19/22 | 15.5s | |
| #269 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #44 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #284 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #248 | Seed-2.0-Code none | Bytedance Seed | 11 | 5.3 | $0.151 | 6/22 | 14.7s |
| #111 | Grok 4.6 low | X AI | 7 | 7.4 | $0.449 | 15/22 | 14.6s |
| #22 | Gemini 3.8 Flash medium | 2 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #302 | Ling 3.0 Tiny none | Inclusionai | 13 | 4.0 | $0.000 | 2/22 | 14.0s |
| #179 | Ling-3.0-flash high | Inclusionai | 7 | 6.4 | $0.021 | 12/22 | 13.7s |
| #151 | GLM 5.3 low | Z.ai | 8 | 6.8 | $0.257 | 12/22 | 13.6s |
| #25 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #95 | GPT-5.4 Nano medium | OpenAI | 8 | 7.5 | $0.142 | 12/22 | 13.3s |
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.1s |
| #36 | Claude Opus 4.8 medium | Anthropic | 4 | 8.8 | $1.983 | 17/22 | 13.0s |
| #223 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.283 | 6/22 | 12.9s |