निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
210/210
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #160 | Laguna XS 2.1 none | Poolside | 3.8 | 5.3 | $0.008 | 0/2 | 364ms |
| #172 | MiniMax M2.7 medium | Minimax | 3.8 | 5.0 | $0.163 | 0/2 | 12.8s |
| #183 | Trinity Large Preview none | Arcee AI | 3.5 | 4.8 | $0.008 | 0/2 | 822ms |
| #201 | Granite 4.1 8B none | IBM Granite | 3.6 | 4.0 | $0.007 | 0/2 | 344ms |
| #203 | Grok 4.1 Fast none | X AI | 3.0 | 3.8 | $0.008 | 0/2 | 685ms |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 4.8 | 3.2 | $0.000 | 0/2 | 541ms |
| #16 | Muse Spark 1.1 medium | Meta | 6.5 | 8.6 | $1.357 | 1/2 | 6.31s |
| #24 | Muse Spark 1.1 low | Meta | 7.3 | 8.3 | $0.647 | 1/2 | 5.42s |
| #27 | Muse Spark 1.1 high | Meta | 6.4 | 8.1 | $1.694 | 1/2 | 7.81s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 7.8 | 7.7 | $0.200 | 1/2 | 8.73s |
| #60 | LongCat 2.0 medium | Meituan | 6.5 | 7.4 | $0.478 | 1/2 | 7.38s |
| #63 | Claude Sonnet 4.6 none | Anthropic | 6.5 | 7.3 | $0.661 | 1/2 | 1.96s |
| #71 | Qwen3.7 Plus none | Qwen | 6.3 | 7.2 | $0.106 | 1/2 | 929ms |
| #74 | GLM 5.1 medium | Z.ai | 6.4 | 7.1 | $0.535 | 1/2 | 7.47s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 6.3 | 6.9 | $0.096 | 1/2 | 4.12s |