AI BENCHY श्रेणी
निर्देश पालन रैंकिंग
देखें कि निर्देश पालन में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
| रैंक | मॉडल | कंपनी | निर्देश पालन स्कोर | स्कोर | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|
| #117 | Qwen3.5-35B-A3B none | Qwen | 6.3 | 5.6 | 1/2 | 809ms |
| #127 | Grok 4.20 none | X AI | 6.3 | 5.4 | 1/2 | 445ms |
| #128 | Qwen3.6 Flash none | Qwen | 6.3 | 5.4 | 1/2 | 1.10s |
| #131 | Qwen3.5-122B-A10B none | Qwen | 6.3 | 5.3 | 1/2 | 513ms |
| #140 | Qwen3 Coder Next none | Qwen | 6.3 | 4.9 | 1/2 | 7.78s |
| #141 | Nemotron 3 Super none | NVIDIA | 6.3 | 4.9 | 1/2 | 804ms |
| #144 | GPT-5.4 Mini none | OpenAI | 6.3 | 4.9 | 1/2 | 728ms |
| #147 | GPT-4o-mini none | OpenAI | 6.3 | 4.8 | 1/2 | 1.11s |
| #148 | GPT-5.4 Nano none | OpenAI | 6.3 | 4.7 | 1/2 | 784ms |
| #150 | Qwen3 Coder Next medium | Qwen | 6.3 | 4.6 | 1/2 | 7.49s |
| #160 | LFM2-24B-A2B none | Liquid | 6.3 | 4.2 | 1/2 | 752ms |
| #113 | DeepSeek V4 Pro none | DeepSeek | 6.3 | 5.7 | 1/2 | 8.23s |
| #145 | Laguna M.1 none | Poolside | 6.3 | 4.8 | 1/2 | 683ms |
| #156 | Hy3 preview none | Tencent | 6.3 | 4.4 | 1/2 | 13.0s |
| #116 | Hunter Alpha none | OpenRouter | 6.4 | 5.7 | 1/2 | 2.82s |