AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Específico do domínio: Tempo esgotado

Específico do domínio
Tempo esgotado

Veja quais modelos de IA têm mais chance de encontrar Tempo esgotado em Específico do domínio, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↑.

Modelos exibidos

15

Falhas totais

34

Modelo mais afetado

GLM 5 1
Posição Modelo Empresa Contagem de Tempo esgotado Pontuação da categoria Testes corretos Tempo de resposta (médio)
#17 GLM 5 medium Z.ai 1 3.5 0/3 0ms
#23 GLM 5 Turbo medium Z.ai 1 2.9 0/3 71.1s
#37 Gemma 4 26B A4B medium Google 1 2.9 0/3 23.6s
#52 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms
#54 GPT-5 Mini medium OpenAI 1 3.6 0/3 44.6s
#66 Qwen3.5-35B-A3B medium Qwen 2 4.1 0/3 88.3s
#72 DeepSeek V3.2 medium DeepSeek 1 2.9 0/3 24.3s
#73 Seed-2.0-Mini medium Bytedance Seed 3 3.0 0/3 0ms
#76 Kimi K2.5 medium Moonshot AI 1 3.5 0/3 137.3s
#79 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#103 DeepSeek V4 Pro high DeepSeek 1 2.9 0/3 205.7s
#105 Nemotron 3 Super medium NVIDIA 1 2.9 0/3 16.2s
#129 MiniMax M2.5 medium Minimax 1 2.9 0/3 237.3s
#130 MiniMax M2.7 medium Minimax 2 3.0 0/3 19.0s
#161 Qwen3.5-9B medium Qwen 3 3.6 0/3 137.7s

Melhores modelos por Contagem de Tempo esgotado

Contagem de Tempo esgotado vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado