Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul.
Model yang ditampilkan
15
Rata-rata Skor Kepatuhan instruksi
8.5
Model terbaik
Gemini 3.6 Flash 10.0
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #287 | Granite 4.2 8B high | IBM Granite | 6.4 | 4.6 | $0.084 | 1/2 | 87.5s |
| #65 | Muse Spark 1.1 high | Meta | 6.4 | 8.0 | $2.253 | 1/2 | 7.81s |
| #186 | Claude Sonnet 5 none | Anthropic | 6.4 | 6.1 | $0.548 | 1/2 | 2.58s |
| #215 | Solar Pro 4 none | Upstage | 6.4 | 5.8 | $0.006 | 1/2 | 1.67s |
| #230 | Owl Alpha none | Openrouter | 6.4 | 5.6 | $0.000 | 1/2 | 2.63s |
| #242 | MiMo-V2.5-Pro none | Xiaomi | 6.4 | 5.4 | $0.068 | 1/2 | 1.03s |
| #249 | Ling-2.6-1T none | Inclusionai | 6.4 | 5.3 | $0.016 | 1/2 | 5.36s |
| #297 | Hunter Alpha none | OpenRouter | 6.4 | 4.2 | $0.000 | 1/2 | 2.82s |
| #265 | Mercury 2.5 Preview low | Inception | 6.3 | 5.0 | $0.011 | 1/2 | 1.60s |
| #292 | Laguna M.1 none | Poolside | 6.3 | 4.4 | $0.009 | 1/2 | 683ms |
| #300 | Hy3 preview none | Tencent | 6.3 | 4.0 | $0.007 | 1/2 | 13.0s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 6.3 | 6.8 | $0.220 | 1/2 | 4.12s |
| #118 | Qwen3.7 Plus none | Qwen | 6.3 | 7.3 | $0.106 | 1/2 | 929ms |
| #163 | Qwen3.5-27B none | Qwen | 6.3 | 6.6 | $0.058 | 1/2 | 1.03s |
| #190 | Qwen3.7 Flash none | Qwen | 6.3 | 6.1 | $0.019 | 1/2 | 892ms |