Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #307 | gpt-oss-120b none | OpenAI | 8 | 3.7 | $0.010 | 6/19 | 21.6s |
| #257 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #290 | Elephant Alpha medium | Openrouter | 9 | 4.3 | $0.000 | 6/21 | 1.27s |
| #201 | Qwen3.5-35B-A3B none | Qwen | 13 | 5.9 | $0.142 | 6/22 | 12.7s |
| #207 | GPT-5.4 Mini none | OpenAI | 13 | 5.9 | $0.095 | 6/22 | 1.58s |
| #215 | Ling-3.0-flash none | Inclusionai | 13 | 5.7 | $0.004 | 6/22 | 3.56s |
| #217 | Kimi K2.6 none | Moonshot AI | 12 | 5.7 | $0.233 | 6/22 | 19.6s |
| #218 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.283 | 6/22 | 12.9s |
| #236 | GPT-5.6 Luna none | OpenAI | 14 | 5.4 | $0.029 | 6/22 | 1.50s |
| #243 | Seed-2.0-Code none | Bytedance Seed | 11 | 5.3 | $0.151 | 6/22 | 14.7s |
| #248 | Inkling none | Thinkingmachines | 13 | 5.2 | $0.147 | 6/22 | 3.47s |
| #260 | Mercury 2.5 Preview low | Inception | 12 | 5.0 | $0.011 | 6/22 | 1.31s |
| #262 | DeepSeek V3.2 none | DeepSeek | 8 | 5.0 | $0.054 | 6/22 | 17.9s |
| #266 | Ling-2.6-flash none | Inclusionai | 9 | 4.9 | $0.002 | 6/22 | 10.7s |
| #306 | Laguna Xs.2 none | Poolside | 8 | 3.8 | $0.004 | 5/19 | 806ms |