Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Metrik ↑.
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #201 | Grok 4.20 Beta medium | X AI | 9.8 | 6.0 | $0.750 | 2/2 | 4.89s |
| #203 | Gemini 3 PRO Preview medium | 9.8 | 6.0 | $0.385 | 2/2 | 3.26s | |
| #204 | GPT-5 Nano medium | OpenAI | 9.8 | 6.0 | $0.118 | 2/2 | 15.6s |
| #213 | Seed 2.1 Turbo none | Bytedance Seed | 9.8 | 5.9 | $0.092 | 2/2 | 1.82s |
| #216 | North Mini Code medium | Cohere | 9.8 | 5.7 | $0.000 | 2/2 | 15.4s |
| #221 | GLM 5.1 none | Z.ai | 9.8 | 5.7 | $0.164 | 2/2 | 1.98s |
| #233 | Hy4 preview low | Tencent | 9.8 | 5.6 | $1.745 | 2/2 | 77.7s |
| #250 | Gemini 3.1 Flash Lite Preview high | 9.8 | 5.3 | $2.310 | 2/2 | 64.0s | |
| #274 | Ring-2.6-1T none | Inclusionai | 9.8 | 4.8 | $0.026 | 2/2 | 27.4s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 9.8 | 4.8 | $5.599 | 2/2 | 3.52s |
| #305 | Grok Build 0.1 none | X AI | 9.8 | 4.0 | $0.547 | 2/2 | 7.36s |
| #312 | gpt-oss-120b none | OpenAI | 9.8 | 3.7 | $0.010 | 2/2 | 5.06s |
| #34 | Muse Spark 1.3 medium | Meta | 9.8 | 8.8 | $1.469 | 2/2 | 10.5s |
| #38 | Gemini 3.6 Flash low | 9.8 | 8.7 | $0.251 | 2/2 | 2.82s | |
| #39 | GLM 5.3 Flash max | Z.ai | 9.8 | 8.7 | $0.059 | 2/2 | 3.65s |