AI BENCHY
Your ad here

Kegagalan AI BENCHY

Kegagalan Jawaban salah

Lihat model AI mana yang paling sering mengalami Jawaban salah, agar Anda bisa melihat risiko keandalan sebelum memilih.

Model yang ditampilkan

15

Total kegagalan

572

Model yang paling terdampak

GPT-4o-mini 13
Peringkat Model Perusahaan Jumlah Jawaban salah Skor Tes benar Waktu respons (rata-rata)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#65 MiMo-V2-Pro none Xiaomi 9 6.0 7/18 2.39s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s
#81 Elephant medium Openrouter 9 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#85 Elephant none Openrouter 9 5.2 5/18 1.23s

Model teratas menurut Jumlah Jawaban salah

Jumlah Jawaban salah vs Skor

Model teratas menurut Waktu respons (rata-rata)