निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
210/210
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #83 | GPT-5.6 Sol none | OpenAI | 8.5 | 6.9 | $0.524 | 1/2 | 1.33s |
| #87 | GPT-5.5 none | OpenAI | 6.2 | 6.9 | $0.544 | 1/2 | 1.15s |
| #88 | Gemini 3.5 Flash minimal | 6.4 | 6.8 | $0.300 | 1/2 | 893ms | |
| #89 | Gemini 3 Flash Preview none | 6.4 | 6.8 | $0.085 | 1/2 | 1.58s | |
| #91 | LongCat 2.0 low | Meituan | 6.5 | 6.7 | $0.391 | 1/2 | 6.39s |
| #97 | LongCat 2.0 high | Meituan | 6.5 | 6.6 | $0.469 | 1/2 | 6.96s |
| #103 | Qwen3.5-27B none | Qwen | 6.3 | 6.5 | $0.090 | 1/2 | 1.03s |
| #111 | LongCat 2.0 none | Meituan | 6.5 | 6.3 | $0.044 | 1/2 | 2.82s |
| #112 | Claude Sonnet 5 none | Anthropic | 6.4 | 6.3 | $0.548 | 1/2 | 2.58s |
| #115 | Gemma 4 31B none | 6.5 | 6.2 | $0.035 | 1/2 | 2.84s | |
| #117 | GPT-5.6 Luna low | OpenAI | 8.5 | 6.2 | $0.249 | 1/2 | 2.04s |
| #124 | Qwen3.6 Flash none | Qwen | 6.3 | 6.1 | $0.062 | 1/2 | 1.10s |
| #125 | Qwen3.5-Flash none | Qwen | 6.3 | 6.1 | $0.073 | 1/2 | 8.81s |
| #126 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.2 | 6.1 | $0.122 | 1/2 | 1.17s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 6.3 | 6.1 | $0.106 | 1/2 | 809ms |