Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Scor ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #243 | Seed-2.0-Code none | Bytedance Seed | 11 | 5.3 | $0.151 | 6/22 | 14.7s |
| #244 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.59s |
| #245 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #246 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |
| #247 | Dots 3 Note Preview none | Dots Studio | 15 | 5.2 | $0.000 | 3/22 | 3.53s |
| #248 | Inkling none | Thinkingmachines | 13 | 5.2 | $0.147 | 6/22 | 3.47s |
| #249 | Granite 4.2 8B medium | IBM Granite | 9 | 5.2 | $0.009 | 7/22 | 46.0s |
| #250 | Nemotron 3.5 Lightning medium | NVIDIA | 13 | 5.1 | $0.156 | 5/22 | 70.1s |
| #251 | Mistral Small 4 none | Mistral | 16 | 5.1 | $0.022 | 5/22 | 1.20s |
| #252 | Mistral Small 4 medium | Mistral | 13 | 5.1 | $0.097 | 5/22 | 10.8s |
| #253 | Granite 4.2 8B low | IBM Granite | 10 | 5.1 | $0.012 | 7/22 | 54.4s |
| #254 | Qwen3 Coder Next none | Qwen | 14 | 5.1 | $0.026 | 5/22 | 8.63s |
| #255 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.68s |
| #256 | Qwen3.5-9B none | Qwen | 14 | 5.1 | $0.021 | 4/22 | 19.2s |
| #257 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |