Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Testes corretos ↑.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #150 | DeepSeek V4 Pro none | DeepSeek | 9 | 6.8 | $0.220 | 9/22 | 11.7s |
| #160 | LongCat 2.0 high | Meituan | 7 | 6.7 | $0.492 | 9/22 | 153.3s |
| #163 | Qwen3.5-27B none | Qwen | 11 | 6.6 | $0.058 | 9/22 | 4.77s |
| #171 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #189 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | $0.020 | 9/22 | 20.8s |
| #191 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #196 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #219 | Inkling Small low | Thinkingmachines | 9 | 5.7 | $0.055 | 9/22 | 2.07s |
| #228 | Gemma 4 26B A4B none | 9 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #236 | Qwen3.8 27B none | Qwen | 11 | 5.5 | ~$0.006 | 9/22 | 3.12s |
| #274 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 52.0s |
| #218 | GLM 5 none | Z.ai | 12 | 5.7 | $0.027 | 9/21 | 4.03s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #282 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #88 | DeepSeek V4 Pro high | DeepSeek | 7 | 7.7 | $0.476 | 10/22 | 92.5s |