Resolução de quebra-cabeças: Resposta incorreta
Resolução de quebra-cabeças
Resposta incorreta
Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Resolução de quebra-cabeças, para identificar pontos fracos mais rápido. Ordenar por: Custo total ↓.
Motivos de falha
142/142
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #181 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 6.7 | $5.599 | 1/3 | 5.19s |
| #43 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $3.059 | 2/3 | 4.71s |
| #4 | GPT-5.6 Sol medium | OpenAI | 1 | 8.2 | $1.316 | 2/3 | 2.98s |
| #86 | Step 3.7 Flash high | Stepfun | 2 | 5.3 | $1.207 | 1/3 | 10.2s |
| #48 | Grok Build 0.1 medium | X AI | 1 | 7.7 | $1.097 | 2/3 | 18.3s |
| #34 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $1.055 | 2/3 | 5.45s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 6.0 | $1.036 | 1/3 | 25.1s |
| #44 | GPT-5.6 Luna high | OpenAI | 1 | 7.6 | $1.017 | 2/3 | 14.6s |
| #28 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.006 | 1/3 | 10.7s |
| #3 | GPT-5.6 Sol low | OpenAI | 1 | 8.2 | $0.971 | 2/3 | 3.44s |
| #31 | GLM 5.2 high | Z.ai | 1 | 6.0 | $0.970 | 1/3 | 33.7s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #73 | Grok 4.3 medium | X AI | 1 | 5.9 | $0.779 | 1/3 | 22.5s |
| #99 | Qwen3.6 27B medium | Qwen | 1 | 7.7 | $0.779 | 2/3 | 61.1s |
| #75 | Grok 4.20 medium | X AI | 1 | 7.7 | $0.777 | 2/3 | 6.22s |