निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
210/210
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #1 | Gemini 3 Flash Preview medium | 10.0 | 9.6 | $0.742 | 2/2 | 4.04s | |
| #2 | Gemini 3.5 Flash high | 10.0 | 9.5 | $1.976 | 2/2 | 3.35s | |
| #3 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.971 | 2/2 | 2.27s |
| #4 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.4 | $1.316 | 2/2 | 2.50s |
| #5 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $1.234 | 2/2 | 2.73s |
| #6 | GPT-5.5 low | OpenAI | 9.9 | 9.3 | $1.253 | 2/2 | 3.74s |
| #7 | Gemini 3.1 Pro Preview medium | 10.0 | 9.2 | $1.361 | 2/2 | 9.56s | |
| #8 | Qwen3.7 Max medium | Qwen | 10.0 | 9.2 | $1.116 | 2/2 | 7.46s |
| #9 | Gemini 3.5 Flash medium | 9.9 | 9.1 | $0.642 | 2/2 | 2.70s | |
| #10 | GPT-5.5 medium | OpenAI | 10.0 | 9.0 | $4.137 | 2/2 | 3.36s |
| #11 | Gemini 3.5 Flash low | 9.9 | 8.9 | $0.433 | 2/2 | 1.86s | |
| #12 | Grok 4.5 high | X AI | 9.8 | 8.9 | $1.707 | 2/2 | 6.23s |
| #13 | GPT-5.3-Codex medium | OpenAI | 10.0 | 8.9 | $0.920 | 2/2 | 3.04s |
| #14 | Claude Opus 4.8 medium | Anthropic | 10.0 | 8.8 | $1.931 | 2/2 | 3.32s |
| #15 | Claude Opus 4.7 medium | Anthropic | 10.0 | 8.7 | $1.477 | 2/2 | 1.57s |