مشترکہ: غیر معتبر ٹول کال
مشترکہ
غیر معتبر ٹول کال
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: کل لاگت ↓.
ناکامی کی وجوہات
زمرے
77/77
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #17 | Claude Fable 5 medium | Anthropic | 1 | 6.5 | $3.478 | 1/2 | 27.5s |
| #2 | Gemini 3.5 Flash high | 1 | 8.2 | $1.976 | 1/2 | 84.1s | |
| #27 | Muse Spark 1.1 high | Meta | 2 | 5.9 | $1.694 | 0/2 | 70.3s |
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $1.627 | 1/2 | 595.2s |
| #16 | Muse Spark 1.1 medium | Meta | 1 | 8.3 | $1.357 | 1/2 | 42.6s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 8.7 | $1.207 | 1/2 | 41.2s |
| #8 | Qwen3.7 Max medium | Qwen | 1 | 8.7 | $1.116 | 1/2 | 287.8s |
| #34 | GPT-5.6 Terra high | OpenAI | 1 | 8.7 | $1.055 | 1/2 | 13.7s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.046 | 1/2 | 313.5s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.036 | 1/2 | 458.6s |
| #28 | Inkling high | Thinkingmachines | 1 | 7.3 | $1.006 | 1/2 | 63.8s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 7.3 | $0.922 | 1/2 | 51.9s |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 3.8 | $0.837 | 0/2 | 512.8s |
| #99 | Qwen3.6 27B medium | Qwen | 2 | 6.7 | $0.779 | 0/2 | 584.1s |
| #75 | Grok 4.20 medium | X AI | 1 | 8.7 | $0.777 | 1/2 | 42.2s |