Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Timp de răspuns (mediu) ↑.
Modele afișate
15
Eșecuri totale
1585
Modelul cel mai afectat
Nemotron 3 Nano Omni 30b A3b Reasoning 9Categorii
În categoria Specific domeniului421 În categoria Trucuri anti-AI293 În categoria Programare259 În categoria Rezolvare de puzzle-uri204 În categoria Cultură generală172 În categoria Combinat69 În categoria Inteligență generală62 În categoria Respectarea instrucțiunilor61 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3
215/215
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #158 | Qwen3.6 27B none | Qwen | 11 | 5.5 | $0.087 | 7/22 | 10.7s |
| #184 | Ling-2.6-flash none | Inclusionai | 9 | 4.9 | $0.002 | 6/22 | 10.7s |
| #173 | Mistral Small 4 medium | Mistral | 12 | 5.1 | $0.096 | 5/22 | 10.8s |
| #38 | GPT-5.6 Terra high | OpenAI | 7 | 8.0 | $1.055 | 14/22 | 11.3s |
| #7 | GPT-5.6 Sol medium | OpenAI | 4 | 9.4 | $1.316 | 18/22 | 11.4s |
| #27 | Muse Spark 1.1 low | Meta | 6 | 8.3 | $0.647 | 13/22 | 11.5s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 8 | 6.9 | $0.096 | 10/22 | 11.6s |
| #8 | GPT-5.6 Sol high | OpenAI | 4 | 9.4 | $1.234 | 18/22 | 11.7s |
| #152 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #75 | Qwen3.7 Plus none | Qwen | 10 | 7.2 | $0.106 | 11/22 | 12.1s |
| #188 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.067 | 5/22 | 12.2s |
| #17 | Claude Opus 4.8 medium | Anthropic | 3 | 8.8 | $1.931 | 18/22 | 12.5s |
| #26 | Claude Sonnet 5 medium | Anthropic | 4 | 8.3 | $0.922 | 16/22 | 12.5s |
| #133 | Qwen3.5-35B-A3B none | Qwen | 12 | 6.1 | $0.106 | 7/22 | 12.7s |
| #45 | Claude Opus 4.8 low | Anthropic | 4 | 7.8 | $2.077 | 16/22 | 12.7s |