AI BENCHY
Your ad here

Falhas AI BENCHY

Falhas por Não seguiu as instruções

Veja quais modelos de IA encontram Não seguiu as instruções com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↓.

Modelos exibidos

5

Falhas totais

180

Modelo mais afetado

Qwen3.5-9B 2
Posição Modelo Empresa Contagem de Não seguiu as instruções Pontuação Testes corretos Tempo de resposta (médio)
#82 Grok 4.20 none X AI 2 5.2 5/18 1.11s
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#98 LFM2-24B-A2B none Liquid 2 4.1 1/16 811ms
#83 Mistral Small 4 none Mistral 2 5.2 5/18 665ms
#91 Mercury 2 none Inception 1 4.8 4/18 613ms

Melhores modelos por Contagem de Não seguiu as instruções

Contagem de Não seguiu as instruções vs Pontuação

Melhores modelos por Tempo de resposta (médio)