Eșecuri AI BENCHY
Eșecuri Fără răspuns
Vezi ce modele AI se lovesc cel mai des de Fără răspuns, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Programare18 În categoria Cultură generală10 În categoria Specific domeniului7 În categoria Parsare și extragere de date5 În categoria Trucuri anti-AI4 În categoria Combinat3 În categoria Apelare instrumente2 În categoria Respectarea instrucțiunilor2 În categoria Rezolvare de puzzle-uri2
37/37
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Fără răspuns | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #79 | Step 3.7 Flash high | Stepfun | 4 | 7.1 | $1.148 | 11/21 | 64.5s |
| #99 | Qwen3.6 27B medium | Qwen | 3 | 6.6 | $0.336 | 10/21 | 59.7s |
| #185 | GLM 4.7 Flash medium | Z.ai | 3 | 4.3 | $0.054 | 4/21 | 35.1s |
| #9 | Claude Fable 5 medium | Anthropic | 2 | 9.2 | $3.165 | 17/21 | 17.0s |
| #17 | GLM 5.2 medium | Z.ai | 2 | 8.7 | $0.215 | 15/21 | 23.3s |
| #58 | Kimi K2.5 medium | Moonshot AI | 2 | 7.5 | $0.348 | 10/21 | 98.4s |
| #75 | Gemma 4 26B A4B medium | 2 | 7.2 | $0.045 | 14/21 | 63.4s | |
| #91 | Mimo V2 Omni medium | Xiaomi | 2 | 6.8 | $0.683 | 10/21 | 41.2s |
| #108 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.3 | $0.401 | 11/21 | 72.6s |
| #139 | Claude Sonnet 5 none | Anthropic | 2 | 5.7 | $0.287 | 7/21 | 4.74s |
| #184 | Laguna Xs.2 medium | Poolside | 2 | 4.3 | $0.015 | 6/19 | 6.73s |
| #193 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.036 | 3/21 | 82.2s |
| #15 | Claude Opus 4.8 medium | Anthropic | 1 | 8.8 | $1.107 | 17/21 | 9.72s |
| #18 | GLM 5 medium | Z.ai | 1 | 8.6 | $0.228 | 15/21 | 33.5s |
| #23 | Step 3.7 Flash medium | Stepfun | 1 | 8.5 | $0.376 | 14/21 | 20.4s |