निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #104 | Gemini 3.8 Flash low | 10.0 | 7.5 | $0.239 | 2/2 | 2.79s | |
| #83 | Claude Opus 4.8 low | Anthropic | 9.8 | 7.8 | $2.089 | 2/2 | 2.78s |
| #152 | MiMo-V2.5-Pro medium | Xiaomi | 9.9 | 6.8 | $0.221 | 2/2 | 2.77s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 2/2 | 2.73s |
| #26 | Gemini 3.5 Flash medium | 9.9 | 9.0 | $0.665 | 2/2 | 2.70s | |
| #243 | Kimi K2.5 none | Moonshot AI | 6.5 | 5.4 | $0.101 | 1/2 | 2.67s |
| #122 | KAT-Coder-Pro V2.5 high | Kwaipilot | 9.9 | 7.2 | $0.506 | 2/2 | 2.67s |
| #9 | GPT-6 Astra low | OpenAI | 10.0 | 9.5 | $1.289 | 2/2 | 2.65s |
| #230 | Owl Alpha none | Openrouter | 6.4 | 5.6 | $0.000 | 1/2 | 2.63s |
| #58 | Gemini 2.5 Flash medium | 9.8 | 8.2 | $0.644 | 2/2 | 2.62s | |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 9.8 | 6.7 | $0.487 | 2/2 | 2.61s |
| #80 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.126 | 2/2 | 2.61s |
| #117 | Gemini 3.1 Flash Lite medium | 9.9 | 7.3 | $0.120 | 2/2 | 2.59s | |
| #186 | Claude Sonnet 5 none | Anthropic | 6.4 | 6.1 | $0.548 | 1/2 | 2.58s |
| #140 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 9.9 | 6.9 | $0.478 | 2/2 | 2.58s |