AI BENCHY বিভাগীয় ব্যর্থতা
সমন্বিত
অবৈধ টুল কল
সমন্বিত
অবৈধ টুল কল
দেখুন সমন্বিত এ কোন AI মডেলগুলোর অবৈধ টুল কল হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: প্রতিক্রিয়া সময় (গড়) ↑.
সম্পর্কিত ব্যর্থতার কারণ
সম্পর্কিত বিভাগ
| র্যাঙ্ক | মডেল | কোম্পানি | অবৈধ টুল কল সংখ্যা | বিভাগ স্কোর | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|
| #49 | GLM 4.7 Flash none | Z.ai | 1 | 10.0 | 0/1 | 3.22s |
| #43 | MiniMax M2.5 medium | Minimax | 1 | 10.0 | 0/1 | 60.4s |
| #52 | GLM 4.7 Flash medium | Z.ai | 1 | 10.0 | 0/1 | 65.6s |
| #33 | DeepSeek V3.2 none | DeepSeek | 1 | 8.0 | 0/1 | 115.9s |