AI BENCHY
Advertise here

Falhas por categoria AI BENCHY

Específico do domínio: Tempo esgotado

Específico do domínio
Tempo esgotado

Veja quais modelos de IA têm mais chance de encontrar Tempo esgotado em Específico do domínio, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↓.

Modelos exibidos

15

Falhas totais

34

Modelo mais afetado

Claude Opus 4.7 1
Posição Modelo Empresa Contagem de Tempo esgotado Pontuação da categoria Testes corretos Tempo de resposta (médio)
#11 Claude Opus 4.7 medium Anthropic 1 7.7 2/3 1.17s
#25 Qwen3.5 Plus 2026-02-15 medium Qwen 1 5.3 1/3 17.5s
#30 Qwen3.5-27B medium Qwen 1 5.3 1/3 79.5s
#42 GPT-5.2 medium OpenAI 1 5.9 1/3 77.8s
#49 Qwen3.5-Flash medium Qwen 1 5.3 1/3 146.5s
#51 Mimo V2 PRO medium Xiaomi 1 5.3 1/3 8.82s
#55 GLM 5.1 medium Z.ai 1 5.3 1/3 29.8s
#60 Kimi K2.6 medium Moonshot AI 2 5.3 1/3 202.4s
#67 MiniMax M3 medium Minimax 2 5.5 1/3 233.1s
#86 Grok 4.1 Fast medium X AI 1 5.8 1/3 121.8s
#94 GPT-5 Nano medium OpenAI 1 5.2 1/3 204.0s
#17 GLM 5 medium Z.ai 1 3.5 0/3 0ms
#23 GLM 5 Turbo medium Z.ai 1 2.9 0/3 71.1s
#37 Gemma 4 26B A4B medium Google 1 2.9 0/3 23.6s
#52 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms

Melhores modelos por Contagem de Tempo esgotado

Contagem de Tempo esgotado vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado