AI BENCHY
Advertise here

AI BENCHY विफलताएँ

अमान्य टूल कॉल विफलताएँ

देखें कि किन AI मॉडलों में अमान्य टूल कॉल सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↓.

दिखाए गए मॉडल

9

कुल विफलताएँ

26

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1
रैंक मॉडल कंपनी अमान्य टूल कॉल संख्या स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#137 Elephant Alpha none Openrouter 1 5.1 5/21 1.22s
#138 Ling-2.6-flash none Inclusionai 2 5.0 6/21 9.34s
#139 DeepSeek V4 Flash none DeepSeek 1 5.0 5/21 26.8s
#145 Laguna M.1 none Poolside 1 4.8 4/19 2.89s
#146 Laguna Xs.2 none Poolside 1 4.8 5/19 806ms
#154 Qwen3.5-9B none Qwen 1 4.6 4/21 1.89s
#158 GLM 4.7 Flash medium Z.ai 1 4.4 4/21 35.1s
#159 Ling-2.6-1T none Inclusionai 1 4.3 3/21 7.72s
#163 Granite 4.1 8B none IBM Granite 1 4.0 2/21 728ms

अमान्य टूल कॉल संख्या के अनुसार शीर्ष मॉडल

अमान्य टूल कॉल संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल