AI BENCHY
Advertise here

Falhas AI BENCHY

Falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↓.

Modelos exibidos

15

Falhas totais

1204

Modelo mais afetado

Gemini 3 Flash Preview 1
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação Testes corretos Tempo de resposta (médio)
#61 Gemini 3.1 Flash Lite low Google 9 7.2 12/21 1.89s
#62 Step 3.5 Flash medium Stepfun 4 7.2 11/20 72.5s
#63 GPT-5.3 Chat none OpenAI 7 7.2 12/21 6.34s
#64 MiMo-V2-Flash medium Xiaomi 5 7.2 12/21 20.1s
#65 Grok 4.20 medium X AI 6 7.1 12/21 27.7s
#66 Qwen3.5-35B-A3B medium Qwen 2 7.1 11/21 72.6s
#67 MiniMax M3 medium Minimax 3 7.1 11/21 68.2s
#68 Claude Opus 4.8 none Anthropic 4 7.0 12/21 3.47s
#69 Claude Opus 4.6 medium Anthropic 3 7.0 12/21 25.9s
#70 GPT-5.4 Nano medium OpenAI 8 7.0 11/21 12.0s
#71 Step 3.7 Flash high Stepfun 6 7.0 11/21 64.5s
#72 DeepSeek V3.2 medium DeepSeek 5 7.0 11/21 68.7s
#73 Seed-2.0-Mini medium Bytedance Seed 4 6.9 11/21 80.2s
#74 Qwen3.6 Max Preview none Qwen 10 6.9 11/21 3.30s
#75 Ring-2.6-1T medium Inclusionai 6 6.9 11/21 61.3s

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)