AI BENCHY श्रेणी अपयशे
कोडी सोडवणे: सूचनांचे पालन केले नाही
कोडी सोडवणे
सूचनांचे पालन केले नाही
कोडी सोडवणे मध्ये कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील. क्रम लावा: बरोबर चाचण्या ↓.
अयशस्वी होण्याची कारणे
| क्रमांक | मॉडेल | कंपनी | सूचनांचे पालन केले नाही संख्या | श्रेणी स्कोअर | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|
| #6 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 9.0 | 2/3 | 11.0s |
| #7 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | 2/3 | 5.12s |
| #10 | Qwen3.5-27B medium | Qwen | 1 | 8.2 | 2/3 | 64.6s |
| #14 | Gemma 4 31B medium | 1 | 8.8 | 2/3 | 27.6s | |
| #16 | GPT-5.4 medium | OpenAI | 1 | 8.2 | 2/3 | 9.13s |
| #24 | Gemma 4 26B A4B medium | 1 | 7.9 | 2/3 | 8.52s | |
| #25 | Grok 4.20 Beta medium | X AI | 1 | 8.2 | 2/3 | 3.85s |
| #31 | GLM 5V Turbo medium | Z.ai | 1 | 7.7 | 2/3 | 10.9s |
| #40 | GPT-5.2 medium | OpenAI | 1 | 7.7 | 2/3 | 5.47s |
| #55 | MiMo-V2-Omni none | Xiaomi | 1 | 8.0 | 2/3 | 2.71s |
| #18 | GLM 5 Turbo medium | Z.ai | 2 | 7.3 | 1/3 | 5.44s |
| #23 | MiMo-V2-Pro medium | Xiaomi | 1 | 7.0 | 1/3 | 4.71s |
| #30 | Step 3.5 Flash medium | Stepfun | 1 | 5.3 | 1/3 | 7.72s |
| #35 | MiMo-V2-Omni medium | Xiaomi | 1 | 6.5 | 1/3 | 3.88s |
| #44 | GPT-5.4 Mini medium | OpenAI | 2 | 6.8 | 1/3 | 4.33s |