Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #272 | Trinity Large Thinking high | Arcee AI | 10 | 4.8 | $0.592 | 5/22 | 75.9s |
| #274 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.070 | 5/22 | 12.5s |
| #275 | GLM 4.7 Flash none | Z.ai | 14 | 4.8 | $0.016 | 5/22 | 8.81s |
| #284 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.327 | 5/22 | 69.1s |
| #287 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |
| #308 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7 | 3.4 | $0.000 | 4/19 | 17.1s |
| #276 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #295 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #296 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 13 | 5.4 | $0.037 | 4/22 | 36.2s |
| #234 | Laguna S 2.1 medium | Poolside | 13 | 5.4 | $0.053 | 4/22 | 58.4s |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 13 | 5.4 | $0.011 | 4/22 | 20.7s |
| #240 | Laguna S 2.1 high | Poolside | 11 | 5.4 | $0.114 | 4/22 | 111.6s |
| #244 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.59s |
| #246 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |