AI BENCHY
Your ad here

Kegagalan AI BENCHY

Kegagalan Tidak mengikuti instruksi

Lihat model AI mana yang paling sering mengalami Tidak mengikuti instruksi, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Jumlah kegagalan ↑.

Model yang ditampilkan

5

Total kegagalan

180

Model yang paling terdampak

Qwen3.6 Plus Preview 1
Peringkat Model Perusahaan Jumlah Tidak mengikuti instruksi Skor Tes benar Waktu respons (rata-rata)
#88 Nemotron 3 Super none NVIDIA 4 5.1 4/18 8.54s
#44 GPT-5.4 Mini medium OpenAI 5 7.3 9/18 15.2s
#84 gpt-oss-120b none OpenAI 5 5.2 4/18 12.0s
#92 Qwen3 Coder Next medium Qwen 5 4.7 3/18 10.8s
#80 MiniMax M2.7 medium Minimax 6 5.3 4/18 31.1s

Model teratas menurut Jumlah Tidak mengikuti instruksi

Jumlah Tidak mengikuti instruksi vs Skor

Model teratas menurut Waktu respons (rata-rata)