Eșecuri pe categorii AI BENCHY
Rezolvare de puzzle-uri: Nu a urmat instrucțiunile
Rezolvare de puzzle-uri
Nu a urmat instrucțiunile
Vezi ce modele AI au cele mai mari șanse să întâmpine Nu a urmat instrucțiunile la Rezolvare de puzzle-uri, ca să găsești mai repede punctele slabe. Sortează după: Timp de răspuns (mediu) ↓.
Motive de eșec
| Rang | Model | Companie | Număr de Nu a urmat instrucțiunile | Scor de categorie | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|
| #10 | Qwen3.5-27B medium | Qwen | 1 | 8.2 | 2/3 | 64.6s |
| #46 | Kimi K2.5 medium | Moonshot AI | 1 | 5.3 | 1/3 | 45.4s |
| #97 | Qwen3.5-9B medium | Qwen | 1 | 3.1 | 0/3 | 33.4s |
| #14 | Gemma 4 31B medium | 1 | 8.8 | 2/3 | 27.6s | |
| #80 | MiniMax M2.7 medium | Minimax | 2 | 3.8 | 0/3 | 25.6s |
| #34 | Kimi K2.6 medium | Moonshot AI | 2 | 5.0 | 0/3 | 25.6s |
| #57 | GPT-5 Nano medium | OpenAI | 1 | 5.3 | 1/3 | 19.8s |
| #45 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | 1/3 | 14.1s |
| #93 | GLM 4.7 Flash medium | Z.ai | 1 | 2.9 | 0/3 | 12.9s |
| #68 | gpt-oss-120b medium | OpenAI | 2 | 3.2 | 0/3 | 11.8s |
| #6 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 9.0 | 2/3 | 11.0s |
| #31 | GLM 5V Turbo medium | Z.ai | 1 | 7.7 | 2/3 | 10.9s |
| #16 | GPT-5.4 medium | OpenAI | 1 | 8.2 | 2/3 | 9.13s |
| #24 | Gemma 4 26B A4B medium | 1 | 7.9 | 2/3 | 8.52s | |
| #51 | Nemotron 3 Super medium | NVIDIA | 2 | 3.5 | 0/3 | 8.39s |