Eșecuri Răspuns greșit
Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Număr de eșecuri ↑.
Categorii
În categoria Specific domeniului421 În categoria Trucuri anti-AI293 În categoria Programare259 În categoria Rezolvare de puzzle-uri204 În categoria Cultură generală172 În categoria Combinat69 În categoria Inteligență generală62 În categoria Respectarea instrucțiunilor61 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3
215/215
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #64 | LongCat 2.0 medium | Meituan | 7 | 7.4 | $0.478 | 12/22 | 136.6s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 7 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #69 | Gemini 3.1 Flash Lite medium | 7 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #98 | GLM 5V Turbo medium | Z.ai | 7 | 6.7 | $0.457 | 11/21 | 23.1s |
| #110 | Gemini 3.1 Flash Lite Preview low | 7 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #112 | Gemini 3.1 Flash Lite Preview none | 7 | 6.4 | $0.052 | 12/22 | 1.58s | |
| #118 | Claude Sonnet 5 none | Anthropic | 7 | 6.3 | $0.548 | 8/22 | 6.04s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 7 | 5.4 | $0.041 | 7/22 | 10.1s |
| #179 | DeepSeek V3.2 none | DeepSeek | 7 | 5.0 | $0.054 | 6/22 | 18.3s |
| #196 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.340 | 5/22 | 68.3s |
| #208 | Grok Build 0.1 none | X AI | 7 | 4.0 | $0.547 | 7/19 | 28.7s |
| #213 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7 | 3.4 | $0.000 | 4/19 | 17.1s |
| #43 | GPT-5.6 Terra medium | OpenAI | 8 | 7.8 | $0.676 | 14/22 | 7.11s |
| #54 | GPT-5.6 Luna medium | OpenAI | 8 | 7.6 | $0.352 | 14/22 | 7.28s |
| #57 | GPT-5.4 Nano medium | OpenAI | 8 | 7.5 | $0.138 | 12/22 | 13.2s |