Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.
Categorii
În categoria Specific domeniului412 În categoria Trucuri anti-AI293 În categoria Programare252 În categoria Rezolvare de puzzle-uri201 În categoria Cultură generală168 În categoria Combinat68 În categoria Respectarea instrucțiunilor61 În categoria Inteligență generală59 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3
209/209
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #28 | Inkling high | Thinkingmachines | 4 | 8.0 | $1.006 | 15/22 | 64.2s |
| #32 | Inkling medium | Thinkingmachines | 4 | 8.0 | $0.391 | 15/22 | 16.2s |
| #36 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.267 | 15/22 | 51.5s |
| #37 | Qwen3.6 Plus medium | Qwen | 5 | 7.8 | $0.405 | 15/22 | 43.1s |
| #44 | GPT-5.6 Luna high | OpenAI | 7 | 7.7 | $1.017 | 15/22 | 18.7s |
| #59 | Qwen3.7 Max none | Qwen | 7 | 7.4 | $0.197 | 15/22 | 4.52s |
| #79 | Gemini 3.5 Flash none | 3 | 7.0 | $1.079 | 15/22 | 9.93s | |
| #49 | GLM 5 Turbo medium | Z.ai | 4 | 7.6 | $0.323 | 14/21 | 23.0s |
| #100 | Hy3 preview medium | Tencent | 3 | 6.5 | $0.018 | 14/21 | 16.3s |
| #133 | Gemini 3 PRO Preview medium | 3 | 6.0 | $0.385 | 14/21 | 9.05s | |
| #21 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #29 | Step 3.7 Flash medium | Stepfun | 5 | 8.0 | $0.515 | 14/22 | 26.4s |
| #30 | GPT-5.2 Chat none | OpenAI | 6 | 8.0 | $0.604 | 14/22 | 7.65s |
| #31 | GLM 5.2 high | Z.ai | 3 | 8.0 | $0.970 | 14/22 | 62.7s |
| #34 | GPT-5.6 Terra high | OpenAI | 7 | 8.0 | $1.055 | 14/22 | 11.3s |