AI BENCHY
Advertise here

Kategori AI BENCHY

Peringkat Kepatuhan instruksi

Lihat model AI mana yang paling baik di Kepatuhan instruksi, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Tes benar ↓.

Model yang ditampilkan

15

Rata-rata Skor Kepatuhan instruksi

8.5

Peringkat Model Perusahaan Skor Kepatuhan instruksi Skor Tes benar Waktu respons (rata-rata)
#80 Mimo V2 Omni medium Xiaomi 8.3 6.7 1/2 4.99s
#85 Gemma 4 31B none Google 6.5 6.5 1/2 2.84s
#86 Grok 4.1 Fast medium X AI 6.5 6.5 1/2 4.63s
#88 Qwen3.7 Plus none Qwen 6.3 6.4 1/2 929ms
#91 GPT-5.5 none OpenAI 6.2 6.4 1/2 1.15s
#93 Qwen3.6 Plus Preview medium Qwen 6.5 6.3 1/2 3.40s
#101 Mimo V2 Omni none Xiaomi 6.5 6.0 1/2 4.26s
#102 Gemma 4 26B A4B none Google 6.3 6.0 1/2 690ms
#105 Nemotron 3 Super medium NVIDIA 7.3 5.8 1/2 6.97s
#106 Grok 4.20 Beta none X AI 6.3 5.8 1/2 649ms
#108 Qwen3.5-Flash none Qwen 6.3 5.8 1/2 8.81s
#109 GLM 5V Turbo none Z.ai 6.5 5.8 1/2 1.97s
#111 Owl Alpha medium Openrouter 6.5 5.7 1/2 10.2s
#113 DeepSeek V4 Pro none DeepSeek 6.3 5.7 1/2 8.23s
#114 Qwen3.5 Plus 2026-04-20 none Qwen 6.2 5.7 1/2 1.17s

Model teratas menurut Skor Kepatuhan instruksi

Skor Kepatuhan instruksi vs total biaya

Model teratas menurut Waktu respons (rata-rata)