Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul.
Model yang ditampilkan
15
Rata-rata Skor Kepatuhan instruksi
8.5
Model terbaik
Gemini 3.6 Flash 10.0
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #113 | Claude Sonnet 4.6 none | Anthropic | 6.5 | 7.3 | $0.661 | 1/2 | 1.96s |
| #141 | Claude Fable 5.1 low | Anthropic | 6.5 | 6.9 | $2.565 | 1/2 | 5.24s |
| #157 | LongCat 2.0 low | Meituan | 6.5 | 6.7 | $0.412 | 1/2 | 6.39s |
| #160 | LongCat 2.0 high | Meituan | 6.5 | 6.7 | $0.492 | 1/2 | 6.96s |
| #177 | LongCat 2.0 none | Meituan | 6.5 | 6.4 | $0.044 | 1/2 | 2.82s |
| #196 | Gemma 4 31B none | 6.5 | 6.1 | $0.016 | 1/2 | 2.84s | |
| #214 | GPT-5.4 none | OpenAI | 6.5 | 5.8 | $0.397 | 1/2 | 1.07s |
| #222 | Kimi K2.6 none | Moonshot AI | 6.5 | 5.7 | $0.233 | 1/2 | 1.64s |
| #226 | GLM 5V Turbo none | Z.ai | 6.5 | 5.6 | $0.052 | 1/2 | 1.97s |
| #227 | Owl Alpha medium | Openrouter | 6.5 | 5.6 | $0.000 | 1/2 | 10.2s |
| #229 | Mimo V2 PRO none | Xiaomi | 6.5 | 5.6 | $0.045 | 1/2 | 2.51s |
| #237 | Mimo V2 Omni none | Xiaomi | 6.5 | 5.5 | $0.021 | 1/2 | 4.26s |
| #238 | DeepSeek V4 Flash 0423 none | DeepSeek | 6.5 | 5.4 | $0.039 | 1/2 | 17.5s |
| #243 | Kimi K2.5 none | Moonshot AI | 6.5 | 5.4 | $0.101 | 1/2 | 2.67s |
| #256 | Mistral Small 4 none | Mistral | 6.5 | 5.1 | $0.022 | 1/2 | 380ms |