निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 9.8 | 6.7 | $0.487 | 2/2 | 2.61s |
| #160 | LongCat 2.0 high | Meituan | 6.5 | 6.7 | $0.492 | 1/2 | 6.96s |
| #73 | Step 3.7 Flash medium | Stepfun | 9.8 | 7.9 | $0.495 | 2/2 | 1.83s |
| #109 | LongCat 2.0 medium | Meituan | 6.5 | 7.4 | $0.499 | 1/2 | 7.38s |
| #161 | Claude Opus 4.7 none | Anthropic | 10.0 | 6.6 | $0.505 | 2/2 | 1.46s |
| #122 | KAT-Coder-Pro V2.5 high | Kwaipilot | 9.9 | 7.2 | $0.506 | 2/2 | 2.67s |
| #13 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.4 | $0.508 | 2/2 | 2.50s |
| #79 | GPT-5.6 Terra medium | OpenAI | 10.0 | 7.8 | $0.523 | 2/2 | 1.43s |
| #98 | GPT 5.3 Chat none | OpenAI | 9.8 | 7.5 | $0.533 | 2/2 | 3.51s |
| #35 | Gemini 3.5 Flash Lite high | 9.8 | 8.8 | $0.540 | 2/2 | 2.16s | |
| #135 | GPT-5.5 none | OpenAI | 6.2 | 7.0 | $0.544 | 1/2 | 1.15s |
| #305 | Grok Build 0.1 none | X AI | 9.8 | 4.0 | $0.547 | 2/2 | 7.36s |
| #186 | Claude Sonnet 5 none | Anthropic | 6.4 | 6.1 | $0.548 | 1/2 | 2.58s |
| #170 | Qwen3.6 27B medium | Qwen | 10.0 | 6.5 | $0.577 | 2/2 | 38.0s |
| #277 | Trinity Large Thinking high | Arcee AI | 6.3 | 4.8 | $0.592 | 1/2 | 4.12s |