Falhas por Resposta incorreta
Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher.
Categorias
Na categoria Específico do domínio421 Na categoria Truques anti-IA293 Na categoria Programação259 Na categoria Resolução de quebra-cabeças204 Na categoria Conhecimentos gerais172 Na categoria Combinado69 Na categoria Inteligência geral62 Na categoria Seguimento de instruções61 Na categoria Análise e extração de dados41 Na categoria Chamada de ferramentas3
215/215
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #93 | Gemini 3 Flash Preview none | 8 | 6.8 | $0.085 | 13/22 | 2.95s | |
| #96 | LongCat 2.0 low | Meituan | 8 | 6.7 | $0.391 | 10/22 | 100.3s |
| #101 | GLM 5.2 none | Z.ai | 8 | 6.6 | $0.128 | 12/22 | 9.34s |
| #126 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #129 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.15s |
| #205 | Hy3 preview none | Tencent | 8 | 4.0 | $0.003 | 4/21 | 12.9s |
| #211 | Laguna Xs.2 none | Poolside | 8 | 3.8 | $0.004 | 5/19 | 806ms |
| #212 | gpt-oss-120b none | OpenAI | 8 | 3.7 | $0.010 | 6/19 | 21.6s |
| #38 | GPT-5.6 Terra high | OpenAI | 7 | 8.0 | $1.055 | 14/22 | 11.3s |
| #48 | GPT-5.6 Luna high | OpenAI | 7 | 7.7 | $1.017 | 15/22 | 18.7s |
| #55 | Nemotron 3 Ultra medium | NVIDIA | 7 | 7.5 | $0.774 | 13/22 | 32.2s |
| #58 | GPT-5.3 Chat none | OpenAI | 7 | 7.5 | $0.571 | 13/22 | 6.88s |
| #63 | Qwen3.7 Max none | Qwen | 7 | 7.4 | $0.197 | 15/22 | 4.52s |
| #64 | LongCat 2.0 medium | Meituan | 7 | 7.4 | $0.478 | 12/22 | 136.6s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 7 | 7.3 | $0.115 | 13/22 | 4.61s |