AI BENCHY श्रेणी अपयशे
कोडी सोडवणे: सूचनांचे पालन केले नाही
कोडी सोडवणे
सूचनांचे पालन केले नाही
कोडी सोडवणे मध्ये कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील. क्रम लावा: बरोबर चाचण्या ↑.
अयशस्वी होण्याची कारणे
| क्रमांक | मॉडेल | कंपनी | सूचनांचे पालन केले नाही संख्या | श्रेणी स्कोअर | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|
| #70 | GPT-5.4 Nano medium | OpenAI | 1 | 4.1 | 0/3 | 3.79s |
| #105 | Nemotron 3 Super medium | NVIDIA | 1 | 3.0 | 0/3 | 3.15s |
| #117 | Qwen3.5-35B-A3B none | Qwen | 1 | 3.7 | 0/3 | 1.35s |
| #119 | Cobuddy medium | Baidu | 1 | 3.6 | 0/3 | 12.8s |
| #124 | Kimi K2.6 none | Moonshot AI | 1 | 3.1 | 0/3 | 1.40s |
| #128 | Qwen3.6 Flash none | Qwen | 1 | 3.5 | 0/3 | 1.21s |
| #131 | Qwen3.5-122B-A10B none | Qwen | 1 | 3.8 | 0/3 | 1.00s |
| #132 | Mistral Small 4 medium | Mistral | 1 | 3.4 | 0/3 | 2.17s |
| #137 | Elephant Alpha none | Openrouter | 1 | 4.2 | 0/3 | 807ms |
| #138 | Ling-2.6-flash none | Inclusionai | 1 | 2.9 | 0/3 | 6.51s |
| #139 | DeepSeek V4 Flash none | DeepSeek | 1 | 3.1 | 0/3 | 23.7s |
| #142 | Mistral Small 4 none | Mistral | 1 | 3.1 | 0/3 | 399ms |
| #147 | GPT-4o-mini none | OpenAI | 1 | 3.5 | 0/3 | 1.21s |
| #150 | Qwen3 Coder Next medium | Qwen | 1 | 3.0 | 0/3 | 1.25s |
| #151 | Trinity Large Preview none | Arcee AI | 1 | 3.6 | 0/3 | 1.97s |