Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Total Biaya ↓.
Model yang ditampilkan
15
Rata-rata Skor Kepatuhan instruksi
8.5
Model terbaik
Grok 4.20 Multi Agent Beta 9.8
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #251 | Qwen3.6 35B A3B none | Qwen | 6.2 | 5.3 | $0.051 | 1/2 | 1.86s |
| #92 | Solar Pro 4 xhigh | Upstage | 8.4 | 7.6 | $0.050 | 1/2 | 51.3s |
| #217 | Nemotron 3 Super medium | NVIDIA | 7.3 | 5.7 | $0.050 | 1/2 | 6.97s |
| #172 | Hy3 preview medium | Tencent | 10.0 | 6.5 | $0.049 | 2/2 | 6.16s |
| #231 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10.0 | 5.6 | $0.048 | 2/2 | 1.50s |
| #149 | Solar Pro 4 medium | Upstage | 9.8 | 6.8 | $0.047 | 2/2 | 40.1s |
| #187 | Gemini 3.1 Flash Lite minimal | 10.0 | 6.1 | $0.047 | 2/2 | 932ms | |
| #262 | GLM 5 Turbo none | Z.ai | 6.5 | 5.1 | $0.047 | 1/2 | 2.13s |
| #130 | Solar Pro 4 high | Upstage | 7.9 | 7.1 | $0.046 | 1/2 | 41.5s |
| #191 | Gemini 3.1 Flash Lite none | 10.0 | 6.1 | $0.046 | 2/2 | 859ms | |
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 9.8 | 5.4 | $0.046 | 2/2 | 1.64s |
| #229 | Mimo V2 PRO none | Xiaomi | 6.5 | 5.6 | $0.045 | 1/2 | 2.51s |
| #177 | LongCat 2.0 none | Meituan | 6.5 | 6.4 | $0.044 | 1/2 | 2.82s |
| #66 | DeepSeek V4 Flash 0731 low | DeepSeek | 9.9 | 8.0 | $0.044 | 2/2 | 3.01s |
| #148 | Solar Pro 4 low | Upstage | 8.0 | 6.8 | $0.044 | 1/2 | 56.4s |