Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↑.
Categorias
Na categoria Específico do domínio659 Na categoria Truques anti-IA386 Na categoria Programação361 Na categoria Resolução de quebra-cabeças275 Na categoria Conhecimentos gerais246 Na categoria Combinado95 Na categoria Inteligência geral90 Na categoria Seguimento de instruções82 Na categoria Análise e extração de dados66 Na categoria Chamada de ferramentas5
313/313
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #301 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #300 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #299 | Laguna Xs.2 medium | Poolside | 6 | 4.1 | $0.015 | 6/19 | 6.73s |
| #298 | Grok 4.20 none | X AI | 10 | 4.1 | $0.057 | 6/18 | 1.11s |
| #297 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #296 | Granite 4.2 8B none | IBM Granite | 11 | 4.3 | $0.026 | 3/22 | 86.3s |
| #295 | Elephant Alpha medium | Openrouter | 9 | 4.3 | $0.000 | 6/21 | 1.27s |
| #294 | GLM 4.7 Flash medium | Z.ai | 9 | 4.3 | $0.168 | 4/22 | 134.3s |
| #293 | Elephant Alpha none | Openrouter | 9 | 4.3 | $0.000 | 5/21 | 1.22s |
| #292 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |
| #291 | Grok 4.20 Beta none | X AI | 10 | 4.4 | $0.087 | 6/18 | 1.19s |
| #290 | Laguna S 2.1 none | Poolside | 18 | 4.5 | $0.022 | 2/22 | 11.7s |
| #289 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.327 | 5/22 | 69.1s |
| #288 | Qwen3 Coder Next medium | Qwen | 14 | 4.6 | $0.034 | 3/22 | 9.07s |
| #287 | Granite 4.2 8B high | IBM Granite | 6 | 4.6 | $0.084 | 4/22 | 235.9s |