مشترکہ: غیر معتبر ٹول کال
مشترکہ
غیر معتبر ٹول کال
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↑.
ناکامی کی وجوہات
زمرے
125/125
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 6.0 | $0.510 | 0/2 | 272.7s |
| #60 | Muse Spark 1.1 high | Meta | 2 | 5.9 | $2.253 | 0/2 | 70.3s |
| #123 | Muse Glimmer 30B low | Meta | 1 | 3.8 | $0.152 | 0/2 | 132.0s |
| #146 | GLM 5.3 low | Z.ai | 1 | 3.8 | $0.257 | 0/2 | 53.0s |
| #151 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.487 | 0/2 | 183.1s |
| #153 | Gemini 3.5 Flash minimal | 2 | 3.0 | $0.300 | 0/2 | 14.4s | |
| #154 | GLM 5V Turbo medium | Z.ai | 1 | 3.4 | $0.457 | 0/1 | 15.1s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/2 | 160.6s | |
| #160 | Inkling Small medium | Thinkingmachines | 2 | 3.8 | $0.113 | 0/2 | 8.89s |
| #161 | Gemini 3.1 Flash Lite low | 1 | 3.2 | $0.621 | 0/2 | 161.2s | |
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.672 | 0/2 | 817.6s |
| #163 | Mercury 2.5 Preview high | Inception | 1 | 3.8 | $0.030 | 0/2 | 14.4s |
| #165 | Qwen3.6 27B medium | Qwen | 2 | 6.7 | $1.045 | 0/2 | 584.1s |
| #174 | Ling-3.0-flash high | Inclusionai | 2 | 2.9 | $0.021 | 0/2 | 50.4s |
| #179 | Gemma 4 31B medium | 1 | 2.9 | $0.100 | 0/2 | 433.1s |