AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Eșecuri pe categorii AI BENCHY

Rezolvare de puzzle-uri: Răspuns greșit

Rezolvare de puzzle-uri
Răspuns greșit

Vezi ce modele AI au cele mai mari șanse să întâmpine Răspuns greșit la Rezolvare de puzzle-uri, ca să găsești mai repede punctele slabe.

Modele afișate

15

Eșecuri totale

85

Modelul cel mai afectat

Kimi K2.5 3
Rang Model Companie Număr de Răspuns greșit Scor de categorie Teste corecte Timp de răspuns (mediu)
#76 Kimi K2.5 none Moonshot AI 3 3.1 0/3 4.73s
#87 Qwen3 Coder Next none Qwen 3 3.2 0/3 22.9s
#89 GPT-4o-mini none OpenAI 3 3.7 0/3 1.30s
#91 Mercury 2 none Inception 3 3.1 0/3 533ms
#94 MiMo-V2-Flash none Xiaomi 3 3.6 0/3 1.38s
#95 Grok 4.1 Fast none X AI 3 3.2 0/3 1.28s
#59 Qwen3.5-Flash none Qwen 2 3.3 0/3 5.90s
#61 Seed-2.0-Lite none Bytedance Seed 2 5.2 1/3 2.46s
#63 Qwen3.5-35B-A3B none Qwen 2 3.9 0/3 1.34s
#70 Qwen3.5-122B-A10B none Qwen 2 5.4 1/3 982ms
#78 Trinity Large Preview none Arcee AI 2 5.4 1/3 3.30s
#85 Elephant none Openrouter 2 3.3 0/3 849ms
#93 GLM 4.7 Flash medium Z.ai 2 2.9 0/3 12.9s
#96 GPT-5.4 Nano none OpenAI 2 3.7 0/3 1.29s
#11 Gemini 3.1 Flash Lite Preview high Google 1 7.7 2/3 46.3s

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)

Top modele după Cost irosit estimat