निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #59 | Muse Spark 1.3 low | Meta | 9.8 | 8.2 | $0.689 | 2/2 | 5.04s |
| #60 | Claude Sonnet 5 medium | Anthropic | 9.9 | 8.2 | $0.922 | 2/2 | 3.10s |
| #61 | Qwen3.8 2.4T A95B low | Qwen | 9.8 | 8.1 | $2.672 | 2/2 | 19.5s |
| #62 | GPT-5 Mini medium | OpenAI | 10.0 | 8.1 | $0.241 | 2/2 | 11.6s |
| #64 | Inkling high | Thinkingmachines | 9.8 | 8.0 | $1.046 | 2/2 | 7.00s |
| #66 | DeepSeek V4 Flash 0731 low | DeepSeek | 9.9 | 8.0 | $0.044 | 2/2 | 3.01s |
| #67 | DeepSeek V4 Flash 0731 high | DeepSeek | 9.8 | 8.0 | $0.084 | 2/2 | 4.46s |
| #68 | GLM 5.2 high | Z.ai | 10.0 | 8.0 | $1.188 | 2/2 | 4.26s |
| #69 | Inkling medium | Thinkingmachines | 9.8 | 8.0 | $0.383 | 2/2 | 6.17s |
| #70 | GPT-5.6 Terra high | OpenAI | 10.0 | 8.0 | $0.836 | 2/2 | 2.14s |
| #71 | Kimi K3 max | Moonshot AI | 10.0 | 7.9 | $3.467 | 2/2 | 7.66s |
| #72 | GPT-5.2 Chat none | OpenAI | 9.8 | 7.9 | $0.594 | 2/2 | 5.51s |
| #73 | Step 3.7 Flash medium | Stepfun | 9.8 | 7.9 | $0.495 | 2/2 | 1.83s |
| #74 | Qwen3.8 27B low | Qwen | 10.0 | 7.9 | ~$0.071 | 2/2 | 2.43s |
| #75 | Qwen3.7 Plus medium | Qwen | 10.0 | 7.9 | $0.277 | 2/2 | 16.1s |