Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #286 | Grok 4.20 Beta none | X AI | 10 | 4.4 | $0.087 | 6/18 | 1.19s |
| #292 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #293 | Grok 4.20 none | X AI | 10 | 4.1 | $0.057 | 6/18 | 1.11s |
| #181 | Claude Sonnet 5 none | Anthropic | 8 | 6.1 | $0.548 | 7/22 | 6.05s |
| #185 | Qwen3.7 Flash none | Qwen | 13 | 6.1 | $0.019 | 7/22 | 10.1s |
| #190 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.73s |
| #200 | Qwen3.5-Flash none | Qwen | 14 | 6.0 | $0.073 | 7/22 | 25.3s |
| #209 | GPT-5.4 none | OpenAI | 14 | 5.8 | $0.397 | 7/22 | 2.08s |
| #210 | Solar Pro 4 none | Upstage | 14 | 5.8 | $0.006 | 7/22 | 5.37s |
| #220 | KAT-Coder-Air V2.5 high | Kwaipilot | 9 | 5.6 | $0.077 | 7/22 | 15.9s |
| #229 | Qwen3.6 27B none | Qwen | 11 | 5.5 | $0.116 | 7/22 | 10.6s |
| #235 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.046 | 7/22 | 10.6s |
| #249 | Granite 4.2 8B medium | IBM Granite | 9 | 5.2 | $0.009 | 7/22 | 46.0s |
| #253 | Granite 4.2 8B low | IBM Granite | 10 | 5.1 | $0.012 | 7/22 | 54.4s |
| #294 | Laguna Xs.2 medium | Poolside | 6 | 4.1 | $0.015 | 6/19 | 6.73s |