Kegagalan Tidak mengikuti instruksi
Lihat model AI mana yang paling sering mengalami Tidak mengikuti instruksi, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Tes benar ↓.
Kategori
Dalam kategori Pemecahan teka-teki128 Dalam kategori Kecerdasan umum115 Dalam kategori Kepatuhan instruksi48 Dalam kategori Trik anti-AI44 Dalam kategori Pemrograman29 Dalam kategori Pemanggilan alat12 Dalam kategori Parsing dan ekstraksi data7 Dalam kategori Spesifik domain2 Dalam kategori Gabungan1
215/215
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Jumlah Tidak mengikuti instruksi | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #165 | Inkling Small medium | Thinkingmachines | 4 | 6.6 | $0.113 | 10/22 | 6.30s |
| #170 | Qwen3.6 27B medium | Qwen | 1 | 6.5 | $0.577 | 10/22 | 106.1s |
| #175 | Dots 3 Note Preview low | Dots Studio | 2 | 6.4 | $0.000 | 10/22 | 61.8s |
| #176 | Dots 3 Note Preview high | Dots Studio | 1 | 6.4 | $0.000 | 10/22 | 67.8s |
| #185 | GPT-5.6 Luna low | OpenAI | 1 | 6.2 | $0.051 | 10/22 | 5.20s |
| #187 | Gemini 3.1 Flash Lite minimal | 3 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #193 | Inkling low | Thinkingmachines | 2 | 6.1 | $0.187 | 10/22 | 5.11s |
| #211 | GLM 5.3 Flash low | Z.ai | 2 | 5.9 | $0.015 | 10/22 | 9.65s |
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #282 | Hunter Alpha medium | OpenRouter | 2 | 4.7 | $0.000 | 8/18 | 10.3s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 6.8 | $0.220 | 9/22 | 11.7s |
| #160 | LongCat 2.0 high | Meituan | 2 | 6.7 | $0.492 | 9/22 | 153.3s |
| #163 | Qwen3.5-27B none | Qwen | 2 | 6.6 | $0.058 | 9/22 | 4.77s |
| #189 | gpt-oss-120b medium | OpenAI | 3 | 6.1 | $0.020 | 9/22 | 20.8s |
| #191 | Gemini 3.1 Flash Lite none | 1 | 6.1 | $0.046 | 9/22 | 1.75s |