AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Falhas por categoria AI BENCHY

Específico do domínio: Resposta incorreta

Específico do domínio
Resposta incorreta

Veja quais modelos de IA têm mais chance de encontrar Resposta incorreta em Específico do domínio, para identificar pontos fracos mais rápido.

Modelos exibidos

15

Falhas totais

182

Modelo mais afetado

Qwen3.6 Plus Preview 3
Posição Modelo Empresa Contagem de Resposta incorreta Pontuação da categoria Testes corretos Tempo de resposta (médio)
#55 MiMo-V2-Omni none Xiaomi 2 5.3 1/3 1.14s
#56 Grok 4.20 Multi Agent Beta medium X AI 2 2.9 0/3 24.7s
#58 GLM 5V Turbo none Z.ai 2 5.3 1/3 2.09s
#62 Gemini 2.5 Flash none Google 2 5.9 1/3 495ms
#65 MiMo-V2-Pro none Xiaomi 2 5.3 1/3 1.78s
#66 GPT-5.4 none OpenAI 2 5.3 1/3 1.07s
#69 Kimi K2.6 none Moonshot AI 2 5.3 1/3 1.48s
#70 Qwen3.5-122B-A10B none Qwen 2 5.3 1/3 465ms
#71 MiniMax M2.5 medium Minimax 2 2.9 0/3 237.3s
#72 Hunter Alpha none OpenRouter 2 5.3 1/3 2.33s
#76 Kimi K2.5 none Moonshot AI 2 5.3 1/3 4.38s
#77 GLM 5 Turbo none Z.ai 2 5.3 1/3 1.97s
#78 Trinity Large Preview none Arcee AI 2 5.3 1/3 877ms
#82 Grok 4.20 none X AI 2 3.0 0/3 687ms
#83 Mistral Small 4 none Mistral 2 5.3 1/3 367ms

Melhores modelos por Contagem de Resposta incorreta

Contagem de Resposta incorreta vs Pontuação

Melhores modelos por Tempo de resposta (médio)

Melhores modelos por Custo desperdiçado estimado