Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Specific domeniului412 În categoria Trucuri anti-AI293 În categoria Programare252 În categoria Rezolvare de puzzle-uri201 În categoria Cultură generală168 În categoria Combinat68 În categoria Respectarea instrucțiunilor61 În categoria Inteligență generală59 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3
209/209
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #124 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.74s |
| #126 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.6s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 12 | 6.1 | $0.106 | 7/22 | 12.7s |
| #129 | Nemotron 3 Ultra none | NVIDIA | 12 | 6.1 | $0.095 | 8/22 | 3.87s |
| #141 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 12 | 5.6 | $0.044 | 5/22 | 36.8s |
| #162 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.58s |
| #167 | Mistral Small 4 medium | Mistral | 12 | 5.1 | $0.096 | 5/22 | 10.8s |
| #171 | North Mini Code none | Cohere | 12 | 5.1 | $0.000 | 4/22 | 29.9s |
| #183 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #87 | GPT-5.5 none | OpenAI | 11 | 6.9 | $0.544 | 11/22 | 2.36s |
| #102 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #122 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #132 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.349 | 8/22 | 1.65s |
| #138 | Kimi K2.6 none | Moonshot AI | 11 | 5.8 | $0.184 | 7/22 | 19.6s |