Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.
Categorii
În categoria Specific domeniului654 În categoria Trucuri anti-AI386 În categoria Programare361 În categoria Rezolvare de puzzle-uri275 În categoria Cultură generală244 În categoria Combinat95 În categoria Inteligență generală90 În categoria Respectarea instrucțiunilor82 În categoria Parsare și extragere de date66 În categoria Apelare instrumente5
309/309
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #142 | Seed-2.0-Code medium | Bytedance Seed | 4 | 6.8 | $1.153 | 10/22 | 101.1s |
| #219 | Gemini 3.1 Flash Lite high | 4 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #230 | Hy3 preview low | Tencent | 4 | 5.5 | $0.042 | 10/21 | 24.6s |
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #277 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #278 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #279 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #11 | GPT-5.5 low | OpenAI | 3 | 9.3 | $1.257 | 19/22 | 10.1s |
| #16 | Claude Opus 5 medium | Anthropic | 3 | 9.2 | $1.586 | 18/22 | 10.3s |
| #18 | Seed 2.1 Turbo low | Bytedance Seed | 3 | 9.1 | $1.546 | 17/22 | 163.9s |
| #20 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #21 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #26 | Muse Spark 1.3 high | Meta | 3 | 8.9 | $1.653 | 16/22 | 52.5s |
| #28 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #35 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.476 | 18/22 | 7.62s |