Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Specific domeniului412 În categoria Trucuri anti-AI293 În categoria Programare252 În categoria Rezolvare de puzzle-uri201 În categoria Cultură generală168 În categoria Combinat68 În categoria Respectarea instrucțiunilor61 În categoria Inteligență generală59 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3
209/209
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #136 | GPT-5.4 Mini none | OpenAI | 13 | 5.9 | $0.095 | 6/22 | 1.53s |
| #142 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.247 | 6/22 | 12.9s |
| #151 | GLM 5.1 none | Z.ai | 13 | 5.5 | $0.164 | 7/22 | 6.70s |
| #161 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.061 | 4/22 | 5.52s |
| #164 | Inkling none | Thinkingmachines | 13 | 5.2 | $0.147 | 6/22 | 3.50s |
| #170 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #176 | GLM 4.7 Flash none | Z.ai | 13 | 4.9 | $0.016 | 6/22 | 9.15s |
| #182 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.067 | 5/22 | 12.2s |
| #187 | Qwen3 Coder Next medium | Qwen | 13 | 4.7 | $0.032 | 4/22 | 9.61s |
| #200 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #201 | Granite 4.1 8B none | IBM Granite | 13 | 4.0 | $0.007 | 2/22 | 1.45s |
| #203 | Grok 4.1 Fast none | X AI | 13 | 3.8 | $0.008 | 3/19 | 1.62s |
| #103 | Qwen3.5-27B none | Qwen | 12 | 6.5 | $0.090 | 8/22 | 4.76s |
| #107 | Qwen3.5 Plus 2026-02-15 none | Qwen | 12 | 6.4 | $0.073 | 10/22 | 9.85s |
| #118 | Gemini 2.5 Flash none | 12 | 6.2 | $0.017 | 9/22 | 6.20s |