Kegagalan kategori AI BENCHY
Kecerdasan umum: Tidak mengikuti instruksi
Kecerdasan umum
Tidak mengikuti instruksi
Lihat model AI mana yang paling mungkin mengalami Tidak mengikuti instruksi di Kecerdasan umum, agar Anda bisa menemukan titik lemahnya lebih cepat. Urutkan berdasarkan: Waktu respons (rata-rata) ↑.
Alasan kegagalan
| Peringkat | Model | Perusahaan | Jumlah Tidak mengikuti instruksi | Skor kategori | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|
| #98 | LFM2-24B-A2B none | Liquid | 1 | 4.0 | 0/1 | 395ms |
| #79 | Grok 4.20 Beta none | X AI | 1 | 5.0 | 0/1 | 541ms |
| #90 | Qwen3.5-9B none | Qwen | 1 | 4.4 | 0/1 | 552ms |
| #91 | Mercury 2 none | Inception | 1 | 4.8 | 0/1 | 628ms |
| #29 | Gemini 3.1 Flash Lite Preview none | 1 | 4.0 | 0/1 | 741ms | |
| #54 | Mercury 2 medium | Inception | 1 | 4.8 | 0/1 | 821ms |
| #85 | Elephant none | Openrouter | 1 | 4.0 | 0/1 | 854ms |
| #81 | Elephant medium | Openrouter | 1 | 4.3 | 0/1 | 920ms |
| #95 | Grok 4.1 Fast none | X AI | 1 | 4.4 | 0/1 | 1.08s |
| #70 | Qwen3.5-122B-A10B none | Qwen | 1 | 5.0 | 0/1 | 1.12s |
| #55 | MiMo-V2-Omni none | Xiaomi | 1 | 4.5 | 0/1 | 1.19s |
| #63 | Qwen3.5-35B-A3B none | Qwen | 1 | 6.5 | 0/1 | 1.19s |
| #96 | GPT-5.4 Nano none | OpenAI | 1 | 3.8 | 0/1 | 1.31s |
| #92 | Qwen3 Coder Next medium | Qwen | 1 | 6.3 | 0/1 | 1.39s |
| #22 | Gemini 3.1 Flash Lite Preview low | 1 | 4.0 | 0/1 | 1.54s |