AI BENCHY
Your ad here

Falhas por categoria AI BENCHY

Combinado: Resposta incorreta

Combinado
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Combinado, para identificar pontos fracos mais rápido.

Modelos exibidos

7

Falhas totais

37

Modelo mais afetado

Gemini 3 Flash Preview 1
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#88 Nemotron 3 Super none NVIDIA 1 3.0 0/1 20.0s
#89 GPT-4o-mini none OpenAI 1 3.0 0/1 7.58s
#91 Mercury 2 none Inception 1 3.0 0/1 606ms
#92 Qwen3 Coder Next medium Qwen 1 3.0 0/1 4.28s
#94 MiMo-V2-Flash none Xiaomi 1 3.0 0/1 2.87s
#95 Grok 4.1 Fast none X AI 1 3.0 0/1 3.33s
#96 GPT-5.4 Nano none OpenAI 1 3.0 0/1 3.84s

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado