AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Específico do domínio: Resposta incorreta

Específico do domínio
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Específico do domínio, para identificar pontos fracos mais rápido. Ordenar por: Tempo de resposta (médio) ↑.

Modelos exibidos

15

Falhas totais

314

Modelo mais afetado

GLM 5 2
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#17 GLM 5 medium Z.ai 2 3.5 0/3 0ms
#52 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms
#160 LFM2-24B-A2B none Liquid 1 5.9 1/3 287ms
#163 Granite 4.1 8B none IBM Granite 3 3.0 0/3 357ms
#142 Mistral Small 4 none Mistral 2 5.3 1/3 367ms
#146 Laguna Xs.2 none Poolside 2 5.3 1/3 371ms
#154 Qwen3.5-9B none Qwen 3 3.0 0/3 464ms
#131 Qwen3.5-122B-A10B none Qwen 2 5.3 1/3 465ms
#117 Qwen3.5-35B-A3B none Qwen 1 7.7 2/3 485ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 3 3.6 0/3 489ms
#97 Gemini 2.5 Flash none Google 2 5.9 1/3 495ms
#155 Mercury 2 none Inception 2 5.3 1/3 534ms
#115 Qwen3.5-27B none Qwen 3 3.0 0/3 540ms
#152 MiMo-V2-Flash none Xiaomi 2 5.3 1/3 564ms
#106 Grok 4.20 Beta none X AI 3 3.0 0/3 611ms

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado