AI BENCHY
Comparar Gráficos Metodologia
❤️ Made by XCS
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Inteligência geral
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Inteligência geral, para identificar pontos fracos mais rápido. Ordenar por: Contagem de falhas ↑.

Modelos exibidos

6

Falhas totais

6

Modelo mais afetado

Qwen3.5 Plus 2026-02-15 1
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#29 Qwen3.5 Plus 2026-02-15 none Qwen 1 4.0 0/1 2.26s
#38 Gemini 2.5 Flash none Google 1 5.0 0/1 615ms
#44 GPT-5.4 none OpenAI 1 3.0 0/1 1.78s
#47 GPT-4o-mini none OpenAI 1 3.0 0/1 909ms
#49 GLM 4.7 Flash none Z.ai 1 3.0 0/1 1.59s
#52 GLM 4.7 Flash medium Z.ai 1 10.0 0/1 18.1s

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs pontuação média

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado