AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Seguimento de instruções: Não seguiu as instruções

Seguimento de instruções
Não seguiu as instruções

Veja quais modelos de IA têm mais chance de encontrar Não seguiu as instruções em Seguimento de instruções, para identificar pontos fracos mais rápido.

Modelos exibidos

7

Falhas totais

22

Posição Modelo Empresa Contagem de Não seguiu as instruções Pontuação da categoria Testes corretos Tempo de resposta (médio)
#80 MiniMax M2.7 medium Minimax 1 3.7 0/2 12.6s
#82 Grok 4.20 none X AI 1 4.8 0/2 455ms
#84 gpt-oss-120b none OpenAI 1 8.4 1/2 5.10s
#88 Nemotron 3 Super none NVIDIA 1 4.9 0/2 1.50s
#89 GPT-4o-mini none OpenAI 1 4.8 0/2 1.27s
#92 Qwen3 Coder Next medium Qwen 1 4.8 0/2 7.34s
#96 GPT-5.4 Nano none OpenAI 1 5.0 0/2 787ms

Melhores modelos por Contagem de Não seguiu as instruções

Contagem de Não seguiu as instruções vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado