निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #99 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 10.0 | 7.5 | $0.459 | 2/2 | 31.9s |
| #100 | Qwen3.5-27B medium | Qwen | 10.0 | 7.5 | $0.982 | 2/2 | 19.7s |
| #101 | Mercury 2.5 Preview medium | Inception | 9.8 | 7.5 | $0.024 | 2/2 | 1.35s |
| #102 | GPT-5.4 Mini medium | OpenAI | 9.8 | 7.5 | $0.786 | 2/2 | 2.13s |
| #103 | Grok Build 0.1 medium | X AI | 9.8 | 7.5 | $1.130 | 2/2 | 12.4s |
| #104 | Gemini 3.8 Flash low | 10.0 | 7.5 | $0.239 | 2/2 | 2.79s | |
| #105 | Gemini 3.1 Flash Lite Preview medium | 10.0 | 7.4 | $0.117 | 2/2 | 1.91s | |
| #106 | Qwen3.7 Max none | Qwen | 10.0 | 7.4 | $0.197 | 2/2 | 943ms |
| #107 | Kimi K2.7 Code medium | Moonshot AI | 9.9 | 7.4 | $0.687 | 2/2 | 5.39s |
| #108 | GPT-5.6 Luna medium | OpenAI | 9.9 | 7.4 | $0.072 | 2/2 | 2.38s |
| #110 | Qwen3.8 2.4T A95B high | Qwen | 9.8 | 7.4 | $2.357 | 2/2 | 11.4s |
| #111 | Grok 4.6 low | X AI | 9.8 | 7.4 | $0.449 | 2/2 | 6.64s |
| #112 | Gemini 3 Flash Preview low | 9.9 | 7.4 | $0.185 | 2/2 | 7.02s | |
| #114 | GLM 5.3 high | Z.ai | 9.8 | 7.3 | $0.403 | 2/2 | 3.62s |
| #115 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10.0 | 7.3 | $0.400 | 2/2 | 2.53s |