AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Eșecuri pe categorii AI BENCHY

Specific domeniului: Răspuns greșit

Specific domeniului
Răspuns greșit

Vezi ce modele AI au cele mai mari șanse să întâmpine Răspuns greșit la Specific domeniului, ca să găsești mai repede punctele slabe.

Modele afișate

15

Eșecuri totale

314

Modelul cel mai afectat

Qwen3.6 Max Preview 3
Rang Model Companie Număr de Răspuns greșit Scor de categorie Teste corecte Timp de răspuns (mediu)
#9 GPT-5.5 medium OpenAI 2 5.3 1/3 164.1s
#10 Claude Opus 4.8 medium Anthropic 2 5.3 1/3 14.2s
#12 Gemini 3.1 Flash Lite Preview high Google 2 5.3 1/3 127.6s
#13 Grok 4.20 Beta medium X AI 2 5.3 1/3 21.3s
#15 GPT-5.3-Codex medium OpenAI 2 5.9 1/3 64.3s
#16 Gemini 3 Flash Preview low Google 2 5.3 1/3 8.05s
#17 GLM 5 medium Z.ai 2 3.5 0/3 0ms
#19 Seed-2.0-Lite medium Bytedance Seed 2 5.9 1/3 88.7s
#21 GPT-5.4 medium OpenAI 2 5.3 1/3 74.3s
#23 GLM 5 Turbo medium Z.ai 2 2.9 0/3 71.1s
#24 GPT-5.2 Chat none OpenAI 2 5.3 1/3 17.8s
#28 Gemini 2.5 Flash medium Google 2 5.9 1/3 37.3s
#33 Hy3 preview medium Tencent 2 5.3 1/3 22.3s
#35 Gemini 3 PRO Preview medium Google 2 5.3 1/3 7.01s
#37 Gemma 4 26B A4B medium Google 2 2.9 0/3 23.6s

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)

Top modele după Cost irosit estimat