निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #98 | GPT 5.3 Chat none | OpenAI | 9.8 | 7.5 | $0.533 | 2/2 | 3.51s |
| #101 | Mercury 2.5 Preview medium | Inception | 9.8 | 7.5 | $0.024 | 2/2 | 1.35s |
| #102 | GPT-5.4 Mini medium | OpenAI | 9.8 | 7.5 | $0.786 | 2/2 | 2.13s |
| #111 | Grok 4.6 low | X AI | 9.8 | 7.4 | $0.449 | 2/2 | 6.64s |
| #126 | Muse Glimmer 30B medium | Meta | 9.8 | 7.2 | $0.211 | 2/2 | 5.34s |
| #129 | Step 3.7 Flash low | Stepfun | 9.8 | 7.1 | $0.390 | 2/2 | 1.58s |
| #137 | Grok 4.20 medium | X AI | 9.8 | 7.0 | $0.805 | 2/2 | 4.26s |
| #146 | Step 3.7 Flash high | Stepfun | 9.8 | 6.8 | $1.229 | 2/2 | 1.52s |
| #147 | Seed-2.0-Code medium | Bytedance Seed | 9.8 | 6.8 | $1.153 | 2/2 | 10.3s |
| #155 | GLM 5.2 none | Z.ai | 9.8 | 6.7 | $0.153 | 2/2 | 3.84s |
| #168 | Mercury 2.5 Preview high | Inception | 9.8 | 6.6 | $0.030 | 2/2 | 1.05s |
| #171 | Laguna XS 2.1 medium | Poolside | 9.8 | 6.5 | $0.068 | 2/2 | 2.57s |
| #174 | Qwen3.6 Max Preview none | Qwen | 9.8 | 6.4 | $0.228 | 2/2 | 1.40s |
| #180 | Ring-2.6-1T medium | Inclusionai | 9.8 | 6.4 | $0.102 | 2/2 | 11.8s |
| #193 | Inkling low | Thinkingmachines | 9.8 | 6.1 | $0.187 | 2/2 | 1.81s |