AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY বিভাগীয় ব্যর্থতা

সমন্বিত: অবৈধ টুল কল

সমন্বিত
অবৈধ টুল কল

দেখুন সমন্বিত এ কোন AI মডেলগুলোর অবৈধ টুল কল হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: প্রতিক্রিয়া সময় (গড়) ↓.

দেখানো মডেল

10

মোট ব্যর্থতা

10

সবচেয়ে বেশি প্রভাবিত মডেল

DeepSeek V3.2 1
র‍্যাঙ্ক মডেল কোম্পানি অবৈধ টুল কল সংখ্যা বিভাগ স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#64 DeepSeek V3.2 none DeepSeek 1 6.5 0/1 115.9s
#93 GLM 4.7 Flash medium Z.ai 1 2.8 0/1 65.6s
#71 MiniMax M2.5 medium Minimax 1 4.5 0/1 60.4s
#80 MiniMax M2.7 medium Minimax 1 4.7 0/1 41.0s
#75 GLM 5.1 none Z.ai 1 2.8 0/1 32.6s
#31 GLM 5V Turbo medium Z.ai 1 6.9 0/1 15.1s
#79 Grok 4.20 Beta none X AI 1 3.0 0/1 6.48s
#82 Grok 4.20 none X AI 1 3.0 0/1 6.04s
#90 Qwen3.5-9B none Qwen 1 3.0 0/1 5.91s
#74 GLM 4.7 Flash none Z.ai 1 3.0 0/1 3.22s

অবৈধ টুল কল সংখ্যা অনুযায়ী শীর্ষ মডেল

অবৈধ টুল কল সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল

আনুমানিক অপচয় হওয়া খরচ অনুযায়ী শীর্ষ মডেল