निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #296 | Granite 4.2 8B none | IBM Granite | 3.0 | 4.3 | $0.026 | 0/2 | 79.5s |
| #302 | Ling 3.0 Tiny none | Inclusionai | 3.1 | 4.0 | $0.000 | 0/2 | 2.44s |
| #303 | Granite 4.1 8B none | IBM Granite | 3.6 | 4.0 | $0.007 | 0/2 | 344ms |
| #308 | Grok 4.1 Fast none | X AI | 3.0 | 3.8 | $0.008 | 0/2 | 685ms |
| #314 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 4.8 | 3.2 | $0.000 | 0/2 | 541ms |
| #31 | Muse Spark 1.3 high | Meta | 6.5 | 8.9 | $1.653 | 1/2 | 14.7s |
| #43 | Muse Spark 1.1 medium | Meta | 6.5 | 8.6 | $1.420 | 1/2 | 6.31s |
| #56 | Muse Spark 1.1 low | Meta | 7.3 | 8.3 | $0.673 | 1/2 | 5.42s |
| #57 | Claude Fable 5.1 medium | Anthropic | 7.3 | 8.3 | $2.909 | 1/2 | 5.77s |
| #63 | Muse Glimmer 30B xhigh | Meta | 8.4 | 8.1 | $0.471 | 1/2 | 8.90s |
| #65 | Muse Spark 1.1 high | Meta | 6.4 | 8.0 | $2.253 | 1/2 | 7.81s |
| #88 | DeepSeek V4 Pro high | DeepSeek | 7.8 | 7.7 | $0.476 | 1/2 | 8.73s |
| #92 | Solar Pro 4 xhigh | Upstage | 8.4 | 7.6 | $0.050 | 1/2 | 51.3s |
| #109 | LongCat 2.0 medium | Meituan | 6.5 | 7.4 | $0.499 | 1/2 | 7.38s |
| #113 | Claude Sonnet 4.6 none | Anthropic | 6.5 | 7.3 | $0.661 | 1/2 | 1.96s |