Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Contagem de falhas ↑.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #86 | Seed-2.0-Code low | Bytedance Seed | 6 | 7.7 | $0.767 | 13/22 | 72.2s |
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 6 | 7.6 | $0.042 | 13/22 | 51.8s |
| #94 | Claude Opus 5 none | Anthropic | 6 | 7.5 | $1.550 | 12/22 | 7.65s |
| #98 | GPT 5.3 Chat none | OpenAI | 6 | 7.5 | $0.533 | 13/22 | 6.56s |
| #102 | GPT-5.4 Mini medium | OpenAI | 6 | 7.5 | $0.786 | 12/22 | 26.7s |
| #103 | Grok Build 0.1 medium | X AI | 6 | 7.5 | $1.130 | 13/22 | 54.5s |
| #105 | Gemini 3.1 Flash Lite Preview medium | 6 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #107 | Kimi K2.7 Code medium | Moonshot AI | 6 | 7.4 | $0.687 | 11/22 | 80.1s |
| #112 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.185 | 16/22 | 6.51s | |
| #114 | GLM 5.3 high | Z.ai | 6 | 7.3 | $0.403 | 13/22 | 27.8s |
| #128 | Muse Glimmer 30B low | Meta | 6 | 7.1 | $0.143 | 11/22 | 18.6s |
| #131 | Grok 4.3 medium | X AI | 6 | 7.0 | $0.741 | 12/22 | 44.2s |
| #137 | Grok 4.20 medium | X AI | 6 | 7.0 | $0.805 | 11/22 | 32.6s |
| #148 | Solar Pro 4 low | Upstage | 6 | 6.8 | $0.044 | 11/22 | 136.1s |
| #158 | Gemini 3.5 Flash minimal | 6 | 6.7 | $0.300 | 13/22 | 2.65s |