Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #63 | GLM 5.2 high | Z.ai | 2 | 8.0 | $1.188 | 14/22 | 69.9s |
| #149 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #183 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $1.140 | 11/22 | 110.8s |
| #245 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #264 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #304 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.062 | 3/22 | 107.5s |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #39 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #310 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |