निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
316/316
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #76 | Qwen3.6 Plus medium | Qwen | 10.0 | 7.8 | $0.418 | 2/2 | 7.54s |
| #77 | Gemini 3.5 Flash Lite medium | 9.8 | 7.8 | $0.272 | 2/2 | 1.72s | |
| #78 | GLM 5.2 medium | Z.ai | 9.9 | 7.8 | $0.224 | 2/2 | 7.90s |
| #79 | GPT-5.6 Terra medium | OpenAI | 10.0 | 7.8 | $0.523 | 2/2 | 1.43s |
| #80 | Claude Sonnet 4.6 medium | Anthropic | 10.0 | 7.8 | $2.126 | 2/2 | 2.61s |
| #81 | Qwen3.8 27B medium | Qwen | 10.0 | 7.8 | ~$0.058 | 2/2 | 2.54s |
| #82 | Seed-2.0-Lite medium | Bytedance Seed | 10.0 | 7.8 | $0.236 | 2/2 | 7.26s |
| #83 | Claude Opus 4.8 low | Anthropic | 9.8 | 7.8 | $2.089 | 2/2 | 2.78s |
| #84 | Qwen3.7 Flash high | Qwen | 9.8 | 7.8 | $0.052 | 2/2 | 9.41s |
| #85 | GLM 5 medium | Z.ai | 10.0 | 7.7 | $0.228 | 2/2 | 7.25s |
| #86 | Seed-2.0-Code low | Bytedance Seed | 9.8 | 7.7 | $0.767 | 2/2 | 12.2s |
| #87 | Claude Opus 4.6 medium | Anthropic | 10.0 | 7.7 | $2.961 | 2/2 | 2.43s |
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 10.0 | 7.6 | $0.042 | 2/2 | 15.4s |
| #90 | GLM 5 Turbo medium | Z.ai | 10.0 | 7.6 | $0.323 | 2/2 | 5.38s |
| #91 | GPT-5.6 Luna high | OpenAI | 9.9 | 7.6 | $0.179 | 2/2 | 1.79s |