AI BENCHY
Your ad here

Kegagalan AI BENCHY

Kegagalan Pemanggilan alat tidak valid

Lihat model AI mana yang paling sering mengalami Pemanggilan alat tidak valid, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Tes benar ↓.

Model yang ditampilkan

12

Total kegagalan

13

Model yang paling terdampak

GLM 5V Turbo 2
Peringkat Model Perusahaan Jumlah Pemanggilan alat tidak valid Skor Tes benar Waktu respons (rata-rata)
#31 GLM 5V Turbo medium Z.ai 2 7.8 11/18 15.0s
#64 DeepSeek V3.2 none DeepSeek 1 6.1 7/18 12.1s
#71 MiniMax M2.5 medium Minimax 1 5.7 5/18 39.6s
#74 GLM 4.7 Flash none Z.ai 1 5.6 5/18 3.35s
#75 GLM 5.1 none Z.ai 1 5.6 5/18 4.33s
#81 Elephant medium Openrouter 1 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 1 5.2 5/18 1.11s
#85 Elephant none Openrouter 1 5.2 5/18 1.23s
#79 Grok 4.20 Beta none X AI 1 5.3 4/18 1.19s
#80 MiniMax M2.7 medium Minimax 1 5.3 4/18 31.1s
#90 Qwen3.5-9B none Qwen 1 4.8 4/18 1.47s
#93 GLM 4.7 Flash medium Z.ai 1 4.6 4/18 32.3s

Model teratas menurut Jumlah Pemanggilan alat tidak valid

Jumlah Pemanggilan alat tidak valid vs Skor

Model teratas menurut Waktu respons (rata-rata)