AI BENCHY
Advertise here

AI BENCHY ناکامیاں

غیر معتبر ٹول کال ناکامیاں

دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

26

سب سے زیادہ متاثر ماڈل

Granite 4.1 8B 1
درجہ ماڈل کمپنی غیر معتبر ٹول کال کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#163 Granite 4.1 8B none IBM Granite 1 4.0 2/21 728ms
#146 Laguna Xs.2 none Poolside 1 4.8 5/19 806ms
#127 Grok 4.20 none X AI 1 5.4 6/18 1.11s
#106 Grok 4.20 Beta none X AI 1 5.8 6/18 1.19s
#137 Elephant Alpha none Openrouter 1 5.1 5/21 1.22s
#136 Elephant Alpha medium Openrouter 1 5.1 6/21 1.27s
#32 Gemini 3.5 Flash minimal Google 1 7.7 14/21 1.57s
#128 Qwen3.6 Flash none Qwen 1 5.4 7/21 1.60s
#154 Qwen3.5-9B none Qwen 1 4.6 4/21 1.89s
#122 GLM 4.7 Flash none Z.ai 1 5.5 6/21 2.86s
#145 Laguna M.1 none Poolside 1 4.8 4/19 2.89s
#118 Qwen3.6 27B none Qwen 1 5.6 7/21 3.72s
#112 GLM 5.1 none Z.ai 1 5.7 7/21 4.10s
#107 Laguna Xs.2 medium Poolside 1 5.8 6/19 6.73s
#159 Ling-2.6-1T none Inclusionai 1 4.3 3/21 7.72s

غیر معتبر ٹول کال کی تعداد کے لحاظ سے سرفہرست ماڈلز

غیر معتبر ٹول کال کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز