निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
210/210
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #58 | Qwen3.5-27B medium | Qwen | 10.0 | 7.4 | $1.627 | 2/2 | 19.7s |
| #27 | Muse Spark 1.1 high | Meta | 6.4 | 8.1 | $1.694 | 1/2 | 7.81s |
| #12 | Grok 4.5 high | X AI | 9.8 | 8.9 | $1.707 | 2/2 | 6.23s |
| #22 | Grok 4.5 medium | X AI | 9.8 | 8.3 | $1.928 | 2/2 | 6.06s |
| #14 | Claude Opus 4.8 medium | Anthropic | 10.0 | 8.8 | $1.931 | 2/2 | 3.32s |
| #2 | Gemini 3.5 Flash high | 10.0 | 9.5 | $1.976 | 2/2 | 3.35s | |
| #143 | Gemini 3.1 Flash Lite high | 7.3 | 5.6 | $2.044 | 1/2 | 23.3s | |
| #40 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.057 | 2/2 | 2.61s |
| #41 | Claude Opus 4.8 low | Anthropic | 9.8 | 7.8 | $2.077 | 2/2 | 2.78s |
| #163 | Gemini 3.1 Flash Lite Preview high | 9.8 | 5.3 | $2.310 | 2/2 | 64.0s | |
| #43 | Claude Opus 4.6 medium | Anthropic | 10.0 | 7.7 | $3.059 | 2/2 | 2.43s |
| #33 | Kimi K3 max | Moonshot AI | 10.0 | 8.0 | $3.112 | 2/2 | 7.66s |
| #17 | Claude Fable 5 medium | Anthropic | 10.0 | 8.6 | $3.478 | 2/2 | 5.90s |
| #10 | GPT-5.5 medium | OpenAI | 10.0 | 9.0 | $4.137 | 2/2 | 3.36s |
| #181 | Grok 4.20 Multi Agent Beta medium | X AI | 9.8 | 4.8 | $5.599 | 2/2 | 3.52s |