Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Metrik ↑.
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #226 | GLM 5V Turbo none | Z.ai | 6.5 | 5.6 | $0.052 | 1/2 | 1.97s |
| #227 | Owl Alpha medium | Openrouter | 6.5 | 5.6 | $0.000 | 1/2 | 10.2s |
| #229 | Mimo V2 PRO none | Xiaomi | 6.5 | 5.6 | $0.045 | 1/2 | 2.51s |
| #237 | Mimo V2 Omni none | Xiaomi | 6.5 | 5.5 | $0.021 | 1/2 | 4.26s |
| #238 | DeepSeek V4 Flash 0423 none | DeepSeek | 6.5 | 5.4 | $0.039 | 1/2 | 17.5s |
| #243 | Kimi K2.5 none | Moonshot AI | 6.5 | 5.4 | $0.101 | 1/2 | 2.67s |
| #256 | Mistral Small 4 none | Mistral | 6.5 | 5.1 | $0.022 | 1/2 | 380ms |
| #260 | MiMo-V2.5 none | Xiaomi | 6.5 | 5.1 | $0.025 | 1/2 | 751ms |
| #261 | Qwen3.5-9B none | Qwen | 6.5 | 5.1 | $0.021 | 1/2 | 514ms |
| #262 | GLM 5 Turbo none | Z.ai | 6.5 | 5.1 | $0.047 | 1/2 | 2.13s |
| #263 | North Mini Code none | Cohere | 6.5 | 5.1 | $0.000 | 1/2 | 30.7s |
| #269 | Qwen3.6 Plus Preview medium | Qwen | 6.5 | 4.9 | $0.000 | 1/2 | 3.40s |
| #280 | GLM 4.7 Flash none | Z.ai | 6.5 | 4.8 | $0.016 | 1/2 | 888ms |
| #283 | Grok 4.1 Fast medium | X AI | 6.5 | 4.7 | $0.069 | 1/2 | 4.63s |
| #286 | Mercury 2 none | Inception | 6.5 | 4.7 | $0.030 | 1/2 | 551ms |