निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
216/216
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #82 | Mercury 2 medium | Inception | 10.0 | 7.0 | $0.093 | 2/2 | 1.07s |
| #109 | Qwen3.5-27B none | Qwen | 6.3 | 6.5 | $0.090 | 1/2 | 1.03s |
| #100 | Gemma 4 26B A4B medium | 10.0 | 6.6 | $0.089 | 2/2 | 17.5s | |
| #158 | Qwen3.6 27B none | Qwen | 6.2 | 5.5 | $0.087 | 1/2 | 1.92s |
| #197 | Grok 4.20 Beta none | X AI | 6.3 | 4.4 | $0.087 | 1/2 | 649ms |
| #93 | Gemini 3 Flash Preview none | 6.4 | 6.8 | $0.085 | 1/2 | 1.58s | |
| #107 | MiMo-V2.5 medium | Xiaomi | 9.9 | 6.5 | $0.082 | 2/2 | 1.80s |
| #80 | DeepSeek V3.2 medium | DeepSeek | 10.0 | 7.0 | $0.078 | 2/2 | 35.8s |
| #150 | KAT-Coder-Air V2.5 high | Kwaipilot | 9.8 | 5.6 | $0.077 | 2/2 | 1.51s |
| #131 | Qwen3.5-Flash none | Qwen | 6.3 | 6.1 | $0.073 | 1/2 | 8.81s |
| #113 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.4 | $0.073 | 2/2 | 1.67s |
| #191 | Grok 4.1 Fast medium | X AI | 6.5 | 4.7 | $0.069 | 1/2 | 4.63s |
| #160 | MiMo-V2.5-Pro none | Xiaomi | 6.4 | 5.5 | $0.068 | 1/2 | 1.03s |
| #108 | Laguna XS 2.1 medium | Poolside | 9.8 | 6.5 | $0.068 | 2/2 | 2.57s |
| #188 | KAT-Coder-Air V2.5 none | Kwaipilot | 9.9 | 4.8 | $0.067 | 2/2 | 1.75s |