Falhas por categoria AI BENCHY
Específico do domínio: Resposta incorreta
Específico do domínio
Resposta incorreta
Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Específico do domínio, para identificar pontos fracos mais rápido.
Motivos de falha
186/186
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #14 | Qwen3.6 Max Preview medium | Qwen | 3 | 2.9 | $0.960 | 0/3 | 95.9s |
| #26 | Grok 4.5 medium | X AI | 3 | 2.9 | $1.696 | 0/3 | 198.9s |
| #27 | DeepSeek V4 Flash high | DeepSeek | 3 | 4.1 | $0.027 | 0/3 | 100.3s |
| #30 | Qwen3.7 Plus medium | Qwen | 3 | 3.6 | $0.177 | 0/3 | 45.3s |
| #31 | Nemotron 3 Ultra 550b A55b medium | NVIDIA | 3 | 3.5 | $0.158 | 0/3 | 24.9s |
| #33 | GPT-5.4 Mini medium | OpenAI | 3 | 4.1 | $0.526 | 0/3 | 65.3s |
| #35 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3 | 4.1 | $0.220 | 0/3 | 17.5s |
| #38 | Qwen3.6 Plus medium | Qwen | 3 | 2.9 | $0.294 | 0/3 | 29.6s |
| #41 | Grok 4.5 low | X AI | 3 | 3.0 | $0.760 | 0/3 | 72.6s |
| #42 | Gemini 3.1 Flash Lite Preview medium | 3 | 3.0 | $0.068 | 0/3 | 4.21s | |
| #43 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 3 | 2.9 | $0.317 | 0/3 | 53.1s |
| #44 | Gemini 3.1 Flash Lite medium | 3 | 2.9 | $0.071 | 0/3 | 3.16s | |
| #46 | Qwen3.5-122B-A10B medium | Qwen | 3 | 2.9 | $0.588 | 0/3 | 63.4s |
| #53 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3 | 2.9 | $0.246 | 0/3 | 35.3s |
| #59 | Mercury 2 medium | Inception | 3 | 2.9 | $0.058 | 0/3 | 6.48s |