निर्देशों का पालन नहीं किया विफलताएँ
देखें कि किन AI मॉडलों में निर्देशों का पालन नहीं किया सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
140/140
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देशों का पालन नहीं किया संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #28 | Inkling high | Thinkingmachines | 1 | 8.0 | $1.006 | 15/22 | 64.2s |
| #163 | Gemini 3.1 Flash Lite Preview high | 1 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #190 | MiniMax M2.5 medium | Minimax | 3 | 4.6 | $0.340 | 5/22 | 68.3s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.0 | $0.078 | 11/22 | 68.6s |
| #108 | Ring-2.6-1T medium | Inclusionai | 2 | 6.3 | $0.103 | 11/22 | 68.7s |
| #47 | MiniMax M3 medium | Minimax | 2 | 7.6 | $0.286 | 12/22 | 75.0s |
| #12 | Grok 4.5 high | X AI | 1 | 8.9 | $1.707 | 17/22 | 76.5s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 2 | 7.7 | $0.200 | 10/22 | 79.1s |
| #204 | Qwen3.5-9B medium | Qwen | 1 | 3.8 | $0.036 | 3/22 | 82.2s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.5 | $0.751 | 12/22 | 84.2s |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 6.2 | $0.139 | 12/22 | 84.8s |
| #80 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 7.0 | $0.101 | 11/22 | 92.5s |
| #77 | Kimi K2.5 medium | Moonshot AI | 2 | 7.0 | $0.600 | 10/22 | 99.0s |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.7 | $0.391 | 10/22 | 100.3s |
| #99 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.779 | 10/22 | 106.3s |