Resolução de quebra-cabeças: Resposta incorreta
Resolução de quebra-cabeças
Resposta incorreta
Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Resolução de quebra-cabeças, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↓.
Motivos de falha
186/186
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Contagem de Resposta incorreta | Pontuação da categoria | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #5 | GPT-5.6 Sol low | OpenAI | 1 | 8.2 | $0.357 | 2/3 | 3.44s |
| #9 | GPT-5.6 Sol medium | OpenAI | 1 | 8.2 | $0.508 | 2/3 | 2.98s |
| #21 | Gemini 3.5 Flash medium | 1 | 7.7 | $0.665 | 2/3 | 2.38s | |
| #53 | Gemini 2.5 Flash medium | 1 | 7.7 | $0.644 | 2/3 | 3.18s | |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $0.836 | 2/3 | 5.45s |
| #67 | GPT-5.2 Chat none | OpenAI | 1 | 7.7 | $0.594 | 2/3 | 4.10s |
| #69 | Qwen3.8 27B low | Qwen | 1 | 7.7 | ~$0.071 | 2/3 | 4.91s |
| #72 | Gemini 3.5 Flash Lite medium | 1 | 8.2 | $0.272 | 2/3 | 1.82s | |
| #73 | GLM 5.2 medium | Z.ai | 1 | 8.2 | $0.224 | 2/3 | 13.1s |
| #74 | GPT-5.6 Terra medium | OpenAI | 1 | 8.4 | $0.523 | 2/3 | 3.78s |
| #82 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 2/3 | 4.71s |
| #86 | GPT-5.6 Luna high | OpenAI | 1 | 7.6 | $0.179 | 2/3 | 14.6s |
| #92 | MiniMax M3 medium | Minimax | 1 | 7.9 | $0.300 | 2/3 | 49.9s |
| #98 | Grok Build 0.1 medium | X AI | 1 | 7.7 | $1.130 | 2/3 | 18.3s |