AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas AI BENCHY

Falhas por Resposta incorreta

Veja quais modelos de IA encontram Resposta incorreta com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Pontuação ↑.

Modelos exibidos

15

Falhas totais

1204

Modelo mais afetado

Granite 4.1 8B 13
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação Testes corretos Tempo de resposta (médio)
#148 GPT-5.4 Nano none OpenAI 15 4.7 4/21 1.48s
#147 GPT-4o-mini none OpenAI 15 4.8 5/21 1.77s
#146 Laguna Xs.2 none Poolside 8 4.8 5/19 806ms
#145 Laguna M.1 none Poolside 10 4.8 4/19 2.89s
#144 GPT-5.4 Mini none OpenAI 13 4.9 5/21 1.13s
#143 MiMo-V2.5 none Xiaomi 14 4.9 5/21 2.20s
#142 Mistral Small 4 none Mistral 15 4.9 5/21 630ms
#141 Nemotron 3 Super none NVIDIA 14 4.9 5/21 5.30s
#140 Qwen3 Coder Next none Qwen 14 4.9 5/21 8.62s
#139 DeepSeek V4 Flash none DeepSeek 12 5.0 5/21 26.8s
#138 Ling-2.6-flash none Inclusionai 9 5.0 6/21 9.34s
#137 Elephant Alpha none Openrouter 9 5.1 5/21 1.22s
#136 Elephant Alpha medium Openrouter 9 5.1 6/21 1.27s
#135 Kimi K2.5 none Moonshot AI 15 5.2 6/21 13.2s
#134 GLM 5 Turbo none Z.ai 13 5.2 6/21 2.82s

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)