निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #266 | Laguna S 2.1 low | Poolside | 4.3 | 5.0 | $0.082 | 0/2 | 423ms |
| #133 | DeepSeek V3.2 medium | DeepSeek | 10.0 | 7.0 | $0.078 | 2/2 | 35.8s |
| #225 | KAT-Coder-Air V2.5 high | Kwaipilot | 9.8 | 5.6 | $0.077 | 2/2 | 1.51s |
| #206 | Qwen3.5-35B-A3B none | Qwen | 6.3 | 5.9 | $0.076 | 1/2 | 809ms |
| #205 | Qwen3.5-Flash none | Qwen | 6.3 | 6.0 | $0.073 | 1/2 | 8.81s |
| #169 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.6 | $0.073 | 2/2 | 1.67s |
| #108 | GPT-5.6 Luna medium | OpenAI | 9.9 | 7.4 | $0.072 | 2/2 | 2.38s |
| #74 | Qwen3.8 27B low | Qwen | 10.0 | 7.9 | ~$0.071 | 2/2 | 2.43s |
| #279 | KAT-Coder-Air V2.5 none | Kwaipilot | 9.9 | 4.8 | $0.070 | 2/2 | 1.75s |
| #283 | Grok 4.1 Fast medium | X AI | 6.5 | 4.7 | $0.069 | 1/2 | 4.63s |
| #242 | MiMo-V2.5-Pro none | Xiaomi | 6.4 | 5.4 | $0.068 | 1/2 | 1.03s |
| #171 | Laguna XS 2.1 medium | Poolside | 9.8 | 6.5 | $0.068 | 2/2 | 2.57s |
| #119 | DeepSeek V4 Flash 0731 medium | DeepSeek | 8.5 | 7.3 | $0.066 | 1/2 | 2.42s |
| #183 | Seed-2.0-Lite none | Bytedance Seed | 10.0 | 6.2 | $0.066 | 2/2 | 1.06s |
| #142 | Qwen3.7 Flash medium | Qwen | 5.8 | 6.9 | $0.065 | 0/2 | 9.27s |