Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Timp de răspuns (mediu) ↓.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #246 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |
| #91 | GPT-5.6 Terra low | OpenAI | 8 | 7.5 | $0.420 | 13/22 | 5.45s |
| #191 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #210 | Solar Pro 4 none | Upstage | 14 | 5.8 | $0.006 | 7/22 | 5.37s |
| #180 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.051 | 10/22 | 5.20s |
| #172 | LongCat 2.0 none | Meituan | 13 | 6.4 | $0.044 | 8/22 | 5.17s |
| #72 | Gemini 3.5 Flash Lite medium | 6 | 7.8 | $0.272 | 14/22 | 5.12s | |
| #188 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.11s |
| #33 | Gemini 3.6 Flash low | 4 | 8.7 | $0.251 | 18/22 | 4.92s | |
| #115 | Claude Opus 4.8 none | Anthropic | 4 | 7.3 | $1.166 | 13/22 | 4.92s |
| #99 | Gemini 3.8 Flash low | 5 | 7.5 | $0.239 | 16/22 | 4.83s | |
| #158 | Qwen3.5-27B none | Qwen | 11 | 6.6 | $0.058 | 9/22 | 4.77s |
| #292 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #255 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.68s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 6 | 7.4 | $0.117 | 14/22 | 4.59s |