AI BENCHY
Your ad here

AI BENCHY अपयशे

अवैध टूल कॉल अपयशे

कोणत्या AI मॉडेल्सना अवैध टूल कॉल सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील.

दाखवलेली मॉडेल्स

12

एकूण अपयशे

13

सर्वाधिक प्रभावित मॉडेल

GLM 5V Turbo 2
क्रमांक मॉडेल कंपनी अवैध टूल कॉल संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#31 GLM 5V Turbo medium Z.ai 2 7.8 11/18 15.0s
#64 DeepSeek V3.2 none DeepSeek 1 6.1 7/18 12.1s
#71 MiniMax M2.5 medium Minimax 1 5.7 5/18 39.6s
#74 GLM 4.7 Flash none Z.ai 1 5.6 5/18 3.35s
#75 GLM 5.1 none Z.ai 1 5.6 5/18 4.33s
#79 Grok 4.20 Beta none X AI 1 5.3 4/18 1.19s
#80 MiniMax M2.7 medium Minimax 1 5.3 4/18 31.1s
#81 Elephant medium Openrouter 1 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 1 5.2 5/18 1.11s
#85 Elephant none Openrouter 1 5.2 5/18 1.23s
#90 Qwen3.5-9B none Qwen 1 4.8 4/18 1.47s
#93 GLM 4.7 Flash medium Z.ai 1 4.6 4/18 32.3s

अवैध टूल कॉल संख्या नुसार शीर्ष मॉडेल्स

अवैध टूल कॉल संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स