AI BENCHY
Advertise here

Kegagalan AI BENCHY

Kegagalan Pemanggilan alat tidak valid

Lihat model AI mana yang paling sering mengalami Pemanggilan alat tidak valid, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Tes benar ↓.

Model yang ditampilkan

9

Total kegagalan

26

Model yang paling terdampak

Gemini 3.5 Flash 1
Peringkat Model Perusahaan Jumlah Pemanggilan alat tidak valid Skor Tes benar Waktu respons (rata-rata)
#129 MiniMax M2.5 medium Minimax 1 5.3 5/21 65.4s
#130 MiniMax M2.7 medium Minimax 1 5.3 5/21 38.2s
#137 Elephant Alpha none Openrouter 1 5.1 5/21 1.22s
#139 DeepSeek V4 Flash none DeepSeek 1 5.0 5/21 26.8s
#145 Laguna M.1 none Poolside 1 4.8 4/19 2.89s
#154 Qwen3.5-9B none Qwen 1 4.6 4/21 1.89s
#158 GLM 4.7 Flash medium Z.ai 1 4.4 4/21 35.1s
#159 Ling-2.6-1T none Inclusionai 1 4.3 3/21 7.72s
#163 Granite 4.1 8B none IBM Granite 1 4.0 2/21 728ms

Model teratas menurut Jumlah Pemanggilan alat tidak valid

Jumlah Pemanggilan alat tidak valid vs Skor

Model teratas menurut Waktu respons (rata-rata)