Peringkat Kepatuhan instruksi
Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Tes benar ↑.
316/316
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Kepatuhan instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #307 | Ling 3.0 Tiny low | Inclusionai | 6.6 | 3.8 | $0.000 | 1/2 | 3.09s |
| #309 | Qwen3.5-9B medium | Qwen | 6.5 | 3.8 | $0.062 | 1/2 | 5.75s |
| #310 | Ling 3.0 Tiny medium | Inclusionai | 6.8 | 3.8 | $0.000 | 1/2 | 3.00s |
| #311 | Laguna Xs.2 none | Poolside | 6.5 | 3.8 | $0.004 | 1/2 | 439ms |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7.3 | 3.4 | $0.000 | 1/2 | 1.37s |
| #316 | LFM2-24B-A2B none | Liquid | 6.3 | 2.2 | $0.001 | 1/2 | 752ms |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $0.699 | 2/2 | 4.07s | |
| #2 | Gemini 3.8 Flash high | 10.0 | 9.9 | $1.595 | 2/2 | 4.73s | |
| #3 | GPT-6 Astra max | OpenAI | 10.0 | 9.9 | $3.803 | 2/2 | 6.34s |
| #4 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $3.474 | 2/2 | 3.58s |
| #5 | GPT-6 Astra xhigh | OpenAI | 10.0 | 9.9 | $5.156 | 2/2 | 4.91s |
| #6 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 2/2 | 3.77s | |
| #7 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.427 | 2/2 | 3.82s | |
| #8 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.5 | $0.357 | 2/2 | 2.27s |
| #9 | GPT-6 Astra low | OpenAI | 10.0 | 9.5 | $1.289 | 2/2 | 2.65s |