AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Específico do domínio: Resposta incorreta

Específico do domínio
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Específico do domínio, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↑.

Modelos exibidos

15

Falhas totais

314

Modelo mais afetado

Qwen3.6 Max Preview 3
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#14 Qwen3.6 Max Preview medium Qwen 3 2.9 0/3 95.9s
#17 GLM 5 medium Z.ai 2 3.5 0/3 0ms
#18 Qwen3.7 Plus medium Qwen 3 3.6 0/3 45.3s
#23 GLM 5 Turbo medium Z.ai 2 2.9 0/3 71.1s
#26 Qwen3.6 Plus medium Qwen 3 2.9 0/3 29.6s
#29 Qwen3.5-122B-A10B medium Qwen 3 2.9 0/3 63.4s
#31 DeepSeek V4 Flash high DeepSeek 3 4.1 0/3 100.3s
#36 Qwen3.5 Plus 2026-04-20 medium Qwen 3 2.9 0/3 53.1s
#37 Gemma 4 26B A4B medium Google 2 2.9 0/3 23.6s
#39 Qwen3.6 Flash medium Qwen 3 3.5 0/3 14.6s
#40 Gemini 3.1 Flash Lite Preview medium Google 3 3.0 0/3 4.21s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 3 3.5 0/3 24.9s
#44 Gemini 3.1 Flash Lite medium Google 3 2.9 0/3 3.16s
#45 GPT-5.4 Mini medium OpenAI 3 4.1 0/3 65.3s
#52 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado