Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Metrik ↑.
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #55 | Inkling Small high | Thinkingmachines | 9.8 | 8.4 | $0.398 | 2/2 | 3.94s |
| #64 | Inkling high | Thinkingmachines | 9.8 | 8.0 | $1.046 | 2/2 | 7.00s |
| #67 | DeepSeek V4 Flash 0731 high | DeepSeek | 9.8 | 8.0 | $0.084 | 2/2 | 4.46s |
| #83 | Claude Opus 4.8 low | Anthropic | 9.8 | 7.8 | $2.089 | 2/2 | 2.78s |
| #95 | GPT-5.4 Nano medium | OpenAI | 9.8 | 7.5 | $0.142 | 2/2 | 1.88s |
| #97 | MiniMax M3 medium | Minimax | 9.8 | 7.5 | $0.300 | 2/2 | 6.14s |
| #103 | Grok Build 0.1 medium | X AI | 9.8 | 7.5 | $1.130 | 2/2 | 12.4s |
| #110 | Qwen3.8 2.4T A95B high | Qwen | 9.8 | 7.4 | $2.357 | 2/2 | 11.4s |
| #114 | GLM 5.3 high | Z.ai | 9.8 | 7.3 | $0.403 | 2/2 | 3.62s |
| #131 | Grok 4.3 medium | X AI | 9.8 | 7.0 | $0.741 | 2/2 | 18.6s |
| #143 | Seed-2.0-Code high | Bytedance Seed | 9.8 | 6.9 | $1.273 | 2/2 | 11.3s |
| #144 | Gemini 3.5 Flash none | 9.8 | 6.9 | $1.093 | 2/2 | 3.38s | |
| #149 | Solar Pro 4 medium | Upstage | 9.8 | 6.8 | $0.047 | 2/2 | 40.1s |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 9.8 | 6.7 | $0.487 | 2/2 | 2.61s |
| #162 | Gemini 3.5 Flash Lite low | 9.8 | 6.6 | $0.138 | 2/2 | 1.75s |