Eșecuri Nu a urmat instrucțiunile
Vezi ce modele AI se lovesc cel mai des de Nu a urmat instrucțiunile, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Număr de eșecuri ↑.
Categorii
În categoria Rezolvare de puzzle-uri128 În categoria Inteligență generală115 În categoria Respectarea instrucțiunilor48 În categoria Trucuri anti-AI44 În categoria Programare29 În categoria Apelare instrumente12 În categoria Parsare și extragere de date7 În categoria Specific domeniului2 În categoria Combinat1
215/215
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Nu a urmat instrucțiunile | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #286 | Mercury 2 none | Inception | 1 | 4.7 | $0.030 | 4/22 | 825ms |
| #290 | Laguna S 2.1 none | Poolside | 1 | 4.5 | $0.022 | 2/22 | 11.7s |
| #291 | Grok 4.20 Beta none | X AI | 1 | 4.4 | $0.087 | 6/18 | 1.19s |
| #296 | Granite 4.2 8B none | IBM Granite | 1 | 4.3 | $0.026 | 3/22 | 86.3s |
| #304 | Nemotron 3.5 Lightning none | NVIDIA | 1 | 4.0 | $0.007 | 3/22 | 1.21s |
| #309 | Qwen3.5-9B medium | Qwen | 1 | 3.8 | $0.062 | 3/22 | 107.5s |
| #311 | Laguna Xs.2 none | Poolside | 1 | 3.8 | $0.004 | 5/19 | 806ms |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 3.4 | $0.000 | 4/19 | 17.1s |
| #315 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |
| #316 | LFM2-24B-A2B none | Liquid | 1 | 2.2 | $0.001 | 2/16 | 782ms |
| #30 | GPT-5.3-Codex medium | OpenAI | 2 | 8.9 | $0.988 | 16/22 | 16.9s |
| #31 | Muse Spark 1.3 high | Meta | 2 | 8.9 | $1.653 | 16/22 | 52.5s |
| #43 | Muse Spark 1.1 medium | Meta | 2 | 8.6 | $1.420 | 15/22 | 26.2s |
| #47 | GPT-5.4 medium | OpenAI | 2 | 8.5 | $1.560 | 15/22 | 22.9s |
| #53 | Qwen3.8 27B high | Qwen | 2 | 8.4 | ~$0.287 | 16/22 | 167.9s |