निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #213 | Seed 2.1 Turbo none | Bytedance Seed | 9.8 | 5.9 | $0.092 | 2/2 | 1.82s |
| #216 | North Mini Code medium | Cohere | 9.8 | 5.7 | $0.000 | 2/2 | 15.4s |
| #218 | GLM 5 none | Z.ai | 10.0 | 5.7 | $0.027 | 2/2 | 1.48s |
| #219 | Inkling Small low | Thinkingmachines | 9.9 | 5.7 | $0.055 | 2/2 | 1.89s |
| #221 | GLM 5.1 none | Z.ai | 9.8 | 5.7 | $0.164 | 2/2 | 1.98s |
| #225 | KAT-Coder-Air V2.5 high | Kwaipilot | 9.8 | 5.6 | $0.077 | 2/2 | 1.51s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10.0 | 5.6 | $0.048 | 2/2 | 1.50s |
| #233 | Hy4 preview low | Tencent | 9.8 | 5.6 | $1.745 | 2/2 | 77.7s |
| #235 | Hy3 preview low | Tencent | 10.0 | 5.5 | $0.042 | 2/2 | 16.0s |
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 9.8 | 5.4 | $0.046 | 2/2 | 1.64s |
| #250 | Gemini 3.1 Flash Lite Preview high | 9.8 | 5.3 | $2.310 | 2/2 | 64.0s | |
| #267 | DeepSeek V3.2 none | DeepSeek | 10.0 | 5.0 | $0.054 | 2/2 | 1.52s |
| #271 | Ling-2.6-flash none | Inclusionai | 9.8 | 4.9 | $0.002 | 2/2 | 5.52s |
| #274 | Ring-2.6-1T none | Inclusionai | 9.8 | 4.8 | $0.026 | 2/2 | 27.4s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 9.8 | 4.8 | $5.599 | 2/2 | 3.52s |