مشترکہ: غیر معتبر ٹول کال
مشترکہ
غیر معتبر ٹول کال
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
زمرے
125/125
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #37 | Muse Spark 1.2 medium | Meta | 1 | 8.5 | $1.339 | 1/2 | 24.9s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 8.3 | $1.420 | 1/2 | 42.6s |
| #39 | Claude Fable 5 medium | Anthropic | 1 | 6.5 | $3.004 | 1/2 | 27.5s |
| #51 | Muse Spark 1.1 low | Meta | 1 | 6.6 | $0.673 | 1/2 | 29.4s |
| #54 | Muse Spark 1.3 low | Meta | 1 | 7.3 | $0.689 | 1/2 | 25.7s |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 7.3 | $0.922 | 1/2 | 51.9s |
| #56 | Qwen3.8 2.4T A95B low | Qwen | 1 | 8.2 | $2.672 | 1/2 | 231.8s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 6.0 | $0.510 | 0/2 | 272.7s |
| #59 | Inkling high | Thinkingmachines | 1 | 7.3 | $1.046 | 1/2 | 63.8s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 8.7 | $0.836 | 1/2 | 13.7s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 7.3 | $0.495 | 1/2 | 80.9s |
| #70 | Qwen3.7 Plus medium | Qwen | 1 | 8.2 | $0.277 | 1/2 | 190.3s |
| #72 | Gemini 3.5 Flash Lite medium | 1 | 7.3 | $0.272 | 1/2 | 17.9s | |
| #76 | Qwen3.8 27B medium | Qwen | 1 | 8.7 | ~$0.058 | 1/2 | 124.5s |
| #79 | Qwen3.7 Flash high | Qwen | 1 | 6.9 | $0.052 | 1/2 | 232.0s |