Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Scor ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #274 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.070 | 5/22 | 12.5s |
| #275 | GLM 4.7 Flash none | Z.ai | 14 | 4.8 | $0.016 | 5/22 | 8.81s |
| #276 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #277 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #278 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #279 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #280 | Cobuddy medium | Baidu | 9 | 4.7 | $0.000 | 7/21 | 39.9s |
| #281 | Mercury 2 none | Inception | 17 | 4.7 | $0.030 | 4/22 | 825ms |
| #282 | Granite 4.2 8B high | IBM Granite | 6 | 4.6 | $0.084 | 4/22 | 235.9s |
| #283 | Qwen3 Coder Next medium | Qwen | 14 | 4.6 | $0.034 | 3/22 | 9.07s |
| #284 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.327 | 5/22 | 69.1s |
| #285 | Laguna S 2.1 none | Poolside | 18 | 4.5 | $0.022 | 2/22 | 11.7s |
| #286 | Grok 4.20 Beta none | X AI | 10 | 4.4 | $0.087 | 6/18 | 1.19s |
| #287 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |