Específico do domínio: Resposta incorreta
Específico do domínio
Resposta incorreta
Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Específico do domínio, para identificar pontos fracos mais rápido.
Motivos de falha
198/198
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #16 | Muse Spark 1.1 medium | Meta | 3 | 3.5 | $1.357 | 0/3 | 71.4s |
| #19 | Qwen3.6 Max Preview medium | Qwen | 3 | 2.9 | $1.143 | 0/3 | 95.9s |
| #20 | Grok 4.5 low | X AI | 3 | 3.0 | $0.935 | 0/3 | 72.6s |
| #22 | Grok 4.5 medium | X AI | 3 | 2.9 | $1.928 | 0/3 | 198.9s |
| #24 | Muse Spark 1.1 low | Meta | 3 | 2.9 | $0.647 | 0/3 | 29.7s |
| #36 | Qwen3.7 Plus medium | Qwen | 3 | 3.6 | $0.267 | 0/3 | 45.3s |
| #37 | Qwen3.6 Plus medium | Qwen | 3 | 2.9 | $0.405 | 0/3 | 29.6s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 3 | 4.1 | $0.042 | 0/3 | 100.3s |
| #51 | Nemotron 3 Ultra medium | NVIDIA | 3 | 3.5 | $0.774 | 0/3 | 24.9s |
| #54 | GPT-5.3 Chat none | OpenAI | 3 | 3.5 | $0.571 | 0/3 | 13.0s |
| #56 | GPT-5.4 Mini medium | OpenAI | 3 | 4.1 | $0.756 | 0/3 | 65.3s |
| #62 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3 | 4.1 | $0.387 | 0/3 | 17.5s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 3 | 3.0 | $0.115 | 0/3 | 4.21s | |
| #65 | Gemini 3.1 Flash Lite medium | 3 | 2.9 | $0.117 | 0/3 | 3.16s | |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3 | 2.9 | $0.482 | 0/3 | 35.3s |