कोडिंग: निर्देशों का पालन नहीं किया
कोडिंग
निर्देशों का पालन नहीं किया
देखें कि कोडिंग में किन AI मॉडलों में निर्देशों का पालन नहीं किया आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: विफलता संख्या ↑.
विफलता के कारण
25/25
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #18 | Gemini 3.5 Flash medium | 1 | 7.9 | $0.665 | 2/3 | 12.6s | |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #104 | Claude Opus 4.8 none | Anthropic | 1 | 5.5 | $1.166 | 1/3 | 3.29s |
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #133 | DeepSeek V4 Pro none | DeepSeek | 1 | 5.6 | $0.351 | 1/3 | 13.4s |
| #138 | GLM 5.2 none | Z.ai | 1 | 3.7 | $0.153 | 0/3 | 7.55s |
| #141 | Gemini 3.5 Flash minimal | 1 | 5.6 | $0.300 | 1/3 | 2.75s | |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #179 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.9 | $0.122 | 0/3 | 1.69s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #222 | MiMo-V2.5-Pro none | Xiaomi | 1 | 4.3 | $0.068 | 0/3 | 1.41s |
| #244 | DeepSeek V3.2 none | DeepSeek | 1 | 3.1 | $0.054 | 0/3 | 14.5s |