निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
216/216
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #177 | North Mini Code none | Cohere | 6.5 | 5.1 | $0.000 | 1/2 | 30.7s |
| #180 | GPT-4o-mini none | OpenAI | 6.3 | 5.0 | $0.010 | 1/2 | 1.11s |
| #181 | Qwen3.6 Plus Preview medium | Qwen | 6.5 | 4.9 | $0.000 | 1/2 | 3.40s |
| #182 | GLM 4.7 Flash none | Z.ai | 6.5 | 4.9 | $0.016 | 1/2 | 888ms |
| #183 | Nemotron 3 Super none | NVIDIA | 6.3 | 4.9 | $0.008 | 1/2 | 804ms |
| #186 | GPT-5.4 Nano none | OpenAI | 6.3 | 4.8 | $0.041 | 1/2 | 784ms |
| #191 | Grok 4.1 Fast medium | X AI | 6.5 | 4.7 | $0.069 | 1/2 | 4.63s |
| #193 | Qwen3 Coder Next medium | Qwen | 6.3 | 4.7 | $0.032 | 1/2 | 7.49s |
| #195 | Mercury 2 none | Inception | 6.5 | 4.6 | $0.030 | 1/2 | 551ms |
| #196 | MiniMax M2.5 medium | Minimax | 7.5 | 4.6 | $0.340 | 1/2 | 621ms |
| #197 | Grok 4.20 Beta none | X AI | 6.3 | 4.4 | $0.087 | 1/2 | 649ms |
| #198 | Laguna M.1 none | Poolside | 6.3 | 4.4 | $0.009 | 1/2 | 683ms |
| #200 | GLM 4.7 Flash medium | Z.ai | 6.2 | 4.3 | $0.166 | 1/2 | 2.97s |
| #202 | Hunter Alpha none | OpenRouter | 6.4 | 4.2 | $0.000 | 1/2 | 2.82s |
| #203 | Grok 4.20 none | X AI | 6.3 | 4.1 | $0.057 | 1/2 | 445ms |