Eșecuri AI BENCHY
Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Specific domeniului314 În categoria Trucuri anti-AI245 În categoria Programare194 În categoria Rezolvare de puzzle-uri147 În categoria Cultură generală130 În categoria Respectarea instrucțiunilor53 În categoria Combinat52 În categoria Parsare și extragere de date35 În categoria Inteligență generală32 În categoria Apelare instrumente2
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|
| #134 | GLM 5 Turbo none | Z.ai | 13 | 5.2 | 6/21 | 2.82s |
| #144 | GPT-5.4 Mini none | OpenAI | 13 | 4.9 | 5/21 | 1.13s |
| #150 | Qwen3 Coder Next medium | Qwen | 13 | 4.6 | 4/21 | 8.58s |
| #152 | MiMo-V2-Flash none | Xiaomi | 13 | 4.6 | 4/21 | 2.76s |
| #153 | Qwen3.6 35B A3B none | Qwen | 13 | 4.6 | 4/21 | 3.73s |
| #157 | Grok 4.1 Fast none | X AI | 13 | 4.4 | 3/19 | 1.62s |
| #163 | Granite 4.1 8B none | IBM Granite | 13 | 4.0 | 2/21 | 728ms |
| #95 | Qwen3.5 Plus 2026-02-15 none | Qwen | 12 | 6.3 | 9/21 | 2.31s |
| #97 | Gemini 2.5 Flash none | 12 | 6.2 | 9/21 | 875ms | |
| #98 | GLM 5 none | Z.ai | 12 | 6.1 | 9/21 | 4.03s |
| #104 | Nemotron 3 Ultra 550b A55b none | NVIDIA | 12 | 6.0 | 8/21 | 2.27s |
| #114 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 5.7 | 7/21 | 4.39s |
| #115 | Qwen3.5-27B none | Qwen | 12 | 5.7 | 7/21 | 1.68s |
| #117 | Qwen3.5-35B-A3B none | Qwen | 12 | 5.6 | 7/21 | 3.37s |
| #128 | Qwen3.6 Flash none | Qwen | 12 | 5.4 | 7/21 | 1.60s |