مشترکہ: غیر معتبر ٹول کال
مشترکہ
غیر معتبر ٹول کال
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.
ناکامی کی وجوہات
زمرے
125/125
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.672 | 0/2 | 817.6s |
| #289 | GLM 4.7 Flash medium | Z.ai | 2 | 2.9 | $0.168 | 0/2 | 802.8s |
| #240 | Laguna S 2.1 high | Poolside | 2 | 2.9 | $0.114 | 0/2 | 702.3s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $0.982 | 1/2 | 595.2s |
| #165 | Qwen3.6 27B medium | Qwen | 2 | 6.7 | $1.045 | 0/2 | 584.1s |
| #282 | Granite 4.2 8B high | IBM Granite | 1 | 5.0 | $0.084 | 0/2 | 570.4s |
| #211 | North Mini Code medium | Cohere | 1 | 2.9 | $0.000 | 0/2 | 554.9s |
| #183 | Qwen3.5-35B-A3B medium | Qwen | 1 | 3.8 | $1.140 | 0/2 | 512.8s |
| #149 | Gemma 4 26B A4B medium | 1 | 6.3 | $0.092 | 1/2 | 492.9s | |
| #116 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.247 | 1/2 | 458.6s |
| #179 | Gemma 4 31B medium | 1 | 2.9 | $0.100 | 0/2 | 433.1s | |
| #261 | Laguna S 2.1 low | Poolside | 1 | 3.2 | $0.082 | 0/2 | 412.5s |
| #189 | Trinity Large Thinking medium | Arcee AI | 2 | 2.9 | $0.756 | 0/2 | 382.7s |
| #137 | Qwen3.7 Flash medium | Qwen | 1 | 6.4 | $0.065 | 1/2 | 314.2s |
| #122 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.207 | 1/2 | 313.5s |