Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Testes corretos ↑.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #83 | Claude Opus 4.8 low | Anthropic | 4 | 7.8 | $2.089 | 16/22 | 12.9s |
| #104 | Gemini 3.8 Flash low | 5 | 7.5 | $0.239 | 16/22 | 4.83s | |
| #112 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.185 | 16/22 | 6.51s | |
| #23 | Seed 2.1 Turbo low | Bytedance Seed | 3 | 9.1 | $1.546 | 17/22 | 163.9s |
| #24 | Qwen3.7 Max medium | Qwen | 4 | 9.1 | $1.157 | 17/22 | 44.3s |
| #28 | Qwen3.8 Max medium | Qwen | 4 | 9.0 | $0.771 | 17/22 | 23.3s |
| #29 | Grok 4.5 high | X AI | 2 | 9.0 | $2.252 | 17/22 | 72.3s |
| #34 | Muse Spark 1.3 medium | Meta | 4 | 8.8 | $1.469 | 17/22 | 38.6s |
| #35 | Gemini 3.5 Flash Lite high | 5 | 8.8 | $0.540 | 17/22 | 10.0s | |
| #36 | Claude Opus 4.8 medium | Anthropic | 4 | 8.8 | $1.983 | 17/22 | 13.0s |
| #44 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #45 | Qwen3.6 Max Preview medium | Qwen | 4 | 8.6 | $1.132 | 17/22 | 66.5s |
| #48 | Grok 4.5 medium | X AI | 5 | 8.5 | $2.042 | 17/22 | 68.6s |
| #201 | Grok 4.20 Beta medium | X AI | 3 | 6.0 | $0.750 | 14/18 | 9.75s |
| #250 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s |