AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Seguimento de instruções: Resposta incorreta

Seguimento de instruções
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Seguimento de instruções, para identificar pontos fracos mais rápido. Ordenar por: Tempo de resposta (médio) ↓.

Modelos exibidos

15

Falhas totais

44

Modelo mais afetado

MiniMax M2.7 1
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#80 MiniMax M2.7 medium Minimax 1 3.7 0/2 12.6s
#59 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#87 Qwen3 Coder Next none Qwen 2 4.8 0/2 7.71s
#33 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#92 Qwen3 Coder Next medium Qwen 1 4.8 0/2 7.34s
#28 GPT-5.2 Chat none OpenAI 1 7.5 1/2 5.46s
#55 MiMo-V2-Omni none Xiaomi 1 6.5 1/2 4.18s
#36 GPT-5.3 Chat none OpenAI 1 8.3 1/2 3.29s
#93 GLM 4.7 Flash medium Z.ai 1 6.2 1/2 2.97s
#48 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#72 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s
#76 Kimi K2.5 none Moonshot AI 1 6.5 1/2 2.67s
#65 MiMo-V2-Pro none Xiaomi 1 6.5 1/2 2.51s
#77 GLM 5 Turbo none Z.ai 1 6.5 1/2 2.13s
#58 GLM 5V Turbo none Z.ai 1 6.5 1/2 1.97s

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado