Eșecuri Fără răspuns
Vezi ce modele AI se lovesc cel mai des de Fără răspuns, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.
Categorii
În categoria Combinat29 În categoria Programare18 În categoria Cultură generală13 În categoria Parsare și extragere de date8 În categoria Specific domeniului8 În categoria Trucuri anti-AI4 În categoria Rezolvare de puzzle-uri3 În categoria Apelare instrumente2 În categoria Respectarea instrucțiunilor2
67/67
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Fără răspuns | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #110 | Gemma 4 31B medium | 1 | 6.3 | $0.163 | 14/22 | 75.4s | |
| #66 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.91s |
| #73 | Grok 4.3 medium | X AI | 1 | 7.1 | $0.779 | 13/22 | 47.4s |
| #74 | GLM 5.1 medium | Z.ai | 1 | 7.1 | $0.535 | 13/22 | 46.8s |
| #89 | Gemini 3 Flash Preview none | 1 | 6.8 | $0.085 | 13/22 | 2.95s | |
| #90 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #143 | Gemini 3.1 Flash Lite high | 1 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #26 | GPT-5 Mini medium | OpenAI | 1 | 8.1 | $0.237 | 12/22 | 27.6s |
| #27 | Muse Spark 1.1 high | Meta | 1 | 8.1 | $1.694 | 12/22 | 31.5s |
| #47 | MiniMax M3 medium | Minimax | 1 | 7.6 | $0.286 | 12/22 | 75.0s |
| #60 | LongCat 2.0 medium | Meituan | 1 | 7.4 | $0.478 | 12/22 | 136.6s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 12/22 | 20.7s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 7.2 | $1.036 | 12/22 | 110.0s |
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 6.5 | $0.082 | 12/22 | 32.2s |
| #106 | Gemini 3.1 Flash Lite Preview none | 1 | 6.4 | $0.052 | 12/22 | 1.58s |