AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Resolução de quebra-cabeças: Erro de API

Resolução de quebra-cabeças
Erro de API

Veja quais modelos de IA têm mais chance de encontrar Erro de API em Resolução de quebra-cabeças, para identificar pontos fracos mais rápido. Ordenar por: Testes corretos ↑.

Modelos exibidos

12

Falhas totais

13

Modelo mais afetado

Laguna M.1 1
Posição Modelo Empresa Contagem de Erro de API Pontuação da categoria Testes corretos Tempo de resposta (médio)
#145 Laguna M.1 none Poolside 1 3.0 0/3 891ms
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 1 2.9 0/3 1.40s
#160 LFM2-24B-A2B none Liquid 1 3.8 0/3 1.78s
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 1 3.0 0/3 532ms
#89 Hy3 preview low Tencent 1 5.3 1/3 7.51s
#92 Laguna M.1 medium Poolside 1 5.3 1/3 10.2s
#93 Qwen3.6 Plus Preview medium Qwen 2 5.3 1/3 7.52s
#103 DeepSeek V4 Pro high DeepSeek 1 5.9 1/3 34.8s
#107 Laguna Xs.2 medium Poolside 1 5.3 1/3 1.93s
#146 Laguna Xs.2 none Poolside 1 5.3 1/3 650ms
#82 Hy3 preview high Tencent 1 7.7 2/3 27.9s
#133 DeepSeek V3.2 none DeepSeek 1 7.6 2/3 6.91s

Melhores modelos por Contagem de Erro de API

Contagem de Erro de API vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado